1 paper · 1 filter
Locke Cai, Max Ryabinin, Ivan Provilkov
Training Large Language Models (LLMs) to reason often relies on Reinforcement Learning (RL) with task-specific verifiers. However, many real-world reasoning-intensive tasks lack ve…