1 paper
Fangyun Wei, Xi Chen, Lin Luo
Despite their sophisticated capabilities, large language models (LLMs) encounter a major hurdle in effective assessment. This paper first revisits the prevalent evaluation method-m…