1 paper
Zhongzhan Huang, Junxin Li, Guoming Ling +3
Comprehensive benchmark suites are essential for improving large language models (LLMs), but many widely used benchmarks are redundant, making evaluation unnecessarily expensive. A…