1 paper
Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison
Reinforcement learning algorithms for Large Language Models (LLMs) are largely distinguished by their variance reduction strategy. Group-relative methods like GRPO reduce gradient…