1 paper
Reinhard Heckel, Mahdi Soltanolkotabi, Christos Thramboulidis
Reinforcement learning with verifiable rewards has driven recent advances in LLM post-training, in particular for reasoning. Policy optimization algorithms generate a number of res…