1 paper
Anmol Kabra, Yilun Yin, Albert Gong +6
Reinforcement Learning (RL) has been shown to significantly boost reasoning capabilities of large language models (LLMs) in math, coding, and multi-hop reasoning tasks. However, RL…