Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Reinforcement-aware Knowledge Distillation for LLM Reasoning
Zhaoyang Zhang, Shuli Jiang, Yantao Shen +6
Reinforcement learning (RL) post-training has recently driven major gains in long chain-of-thought reasoning large language models (LLMs), but the high inference cost of such model…
cs.LG2026
Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models
Xiaoze Liu, Dhananjay Ram, Yuting Zhang +3
We introduce Mutual Reinforcement Learning, a framework for concurrent RL post-training in which heterogeneous LLM policies exchange typed experience while keeping separate paramet…