1 paper
Luzhou Peng, Zhengxin Yang, Honglu Ji +6
Current evaluation paradigms for large language models (LLMs) characterize models and datasets separately, yielding coarse descriptions: items in datasets are treated as pre-labele…