2 papers
cs.LG2026
RPO: Decoupling Rollout and Inference Policies for LLM Reasoning
Jingchu Wang, Bingbing Xu, Yige Yuan +4
Existing reinforcement learning methods for LLM reasoning implicitly assume that the policy generating training trajectories should coincide with the one producing inference respon…
cs.CL2026
GIFT: Games as Informal Training for Generalizable LLMs
Nuoyan Lyu, Bingbing Xu, Xueyun Tian +6
Recent LLMs excel at formal tasks such as mathematical reasoning and code generation, but still struggle with broader abilities such as planning, creativity, and social intelligenc…