41 citations · 102 across the 38 of their papers we have counts for
1 paper · 2 filters
Luzhou Peng, Zhengxin Yang, Honglu Ji +6
Current evaluation paradigms for large language models (LLMs) characterize models and datasets separately, yielding coarse descriptions: items in datasets are treated as pre-labele…