Showing cs.CLShow all
2 papers · 1 filter
cs.CL2024
Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning
Mathieu Rita, Florian Strub, Rahma Chaabouni +3
While Reinforcement Learning (RL) has been proven essential for tuning large language models (LLMs), it can lead to reward over-optimization (ROO). Existing approaches address ROO…
cs.CL2023
On the Correspondence between Compositionality and Imitation in Emergent Neural Communication
Emily Cheng, Mathieu Rita, Thierry Poibeau
Compositionality is a hallmark of human language that not only enables linguistic generalization, but also potentially facilitates acquisition. When simulating language emergence w…