1 paper
Locke Cai, Max Ryabinin, Ivan Provilkov
Training Large Language Models (LLMs) to reason often relies on Reinforcement Learning (RL) with task-specific verifiers. However, many real-world reasoning-intensive tasks lack ve…