1 paper
Mathieu Rita, Florian Strub, Rahma Chaabouni +3
While Reinforcement Learning (RL) has been proven essential for tuning large language models (LLMs), it can lead to reward over-optimization (ROO). Existing approaches address ROO…