1 paper
Wenqi Zheng, Yutaka Arakawa
Reinforcement learning in large reasoning models enables learning from feedback on their outputs, making it particularly valuable in scenarios where fine-tuning data is limited. Ho…