1 paper · 1 filter
Siyan Zhao, Devaansh Gupta, Qinqing Zheng +1
Recent large language models (LLMs) have demonstrated strong reasoning capabilities that benefits from online reinforcement learning (RL). These capabilities have primarily been de…