1 paper · 1 filter
Zongjie Li, Chaozheng Wang, Pingchuan Ma +4
Large language models (LLMs) have shown promise as automated evaluators for assessing the quality of answers generated by AI systems. However, these LLM-based evaluators exhibit po…