1 paper
Ruosen Li, Teerth Patel, Xinya Du
Nowadays, the quality of responses generated by different modern large language models (LLMs) is hard to evaluate and compare automatically. Recent studies suggest and predominantl…