LLM Evaluator

BLEU · ROUGE · METEOR · Perplexity — measure text generation quality side by side

Try these examples: