1 paper · 1 filter
Germán Kruszewski, Pierre Erbacher, Jos Rozen +1
Reinforcement Learning (RL) has become the de facto standard for tuning LLMs to solve tasks involving reasoning. However, growing evidence shows that models trained in such way oft…