1 paper
Fan Yang, Rui Meng, Trudi Di Qi +2
Reinforcement learning (RL) has emerged as a promising paradigm for inducing explicit reasoning behaviors in large language and vision-language models. However, reasoning-oriented…