1 paper · 1 filter
Zhongzhan Huang, Junxin Li, Guoming Ling +3
Comprehensive benchmark suites are essential for improving large language models (LLMs), but many widely used benchmarks are redundant, making evaluation unnecessarily expensive. A…