1 paper · 1 filter
Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan +2
Reinforcement learning is widely used to improve the reasoning ability of large language models, especially when answers can be automatically checked. Standard GRPO-style training…