1 paper
Zhiwei Zhang, Xiaomin Li, Yudi Lin +8
Large Language Models (LLMs) trained with reinforcement learning and verifiable rewards have achieved strong results on complex reasoning tasks. Recent work extends this paradigm t…