1 paper
Zihan Chen, Yiming Zhang, Wenxiang Geng +2
Large Language Models (LLMs) aligned via outcome-based Reinforcement Learning (RL) frequently exhibit a critical failure mode: they achieve high performance on in-distribution benc…