1 paper · 1 filter
Zhishuai Liu, Xingzi Xu, Mehmet Saygin Seyfioglu +2
Large language models demonstrate increasingly strong reasoning capabilities through effective post-training. Yet, prevailing post-training methods optimize over massive numbers of…