1 paper · 1 filter
Bangzheng Li, Jianmo Ni, Chen Qu +5
Post-training with Reinforcement Learning (RL) has substantially improved reasoning in Large Language Models (LLMs) via test-time scaling. However, extending this paradigm to Multi…