1 paper · 1 filter
Yuyang Xu, Yi Cheng, Haochao Ying +5
Test-time scaling has proven effective in further enhancing the performance of pretrained Large Language Models (LLMs). However, mainstream post-training methods (i.e., reinforceme…