1 paper
Seonil Son, Ju-Min Oh, Heegon Jin +3
As Large Language Models (LLMs) expand across domains, LLM judges have become essential for systems evaluation. Current benchmarks typically compare system outputs against baseline…