1 paper · 1 filter
Hongjian Zou, Yidan Wang, Qi Ding +2
Large language models often achieve strong benchmark gains without corresponding improvements in broader capability. We hypothesize that this discrepancy arises from differences in…