1 paper · 1 filter
Shaobo Wang, Cong Wang, Wenjie Fu +11
As the demand for comprehensive evaluations of diverse model capabilities steadily increases, benchmark suites have correspondingly grown significantly in scale. Despite notable ad…