Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Trajectory-Refined Distillation
Li Jiang, Haoran Xu, Yichuan Ding +1
On-policy distillation (OPD) has become a central post-training tool for large language models (LLMs), providing dense per-token teacher supervision along the student's own rollout…
cs.AI2025
Information-Theoretic Reward Decomposition for Generalizable RLHF
Liyuan Mao, Haoran Xu, Amy Zhang +2
A generalizable reward model is crucial in Reinforcement Learning from Human Feedback (RLHF) as it enables correctly evaluating unseen prompt-response pairs. However, existing rewa…