2 papers
cs.LG2026
Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
Tong Zheng, Skylar Zhai, Zhan Cheng +7
Multi-reward reinforcement learning trains large language models to satisfy multiple behavioral objectives simultaneously. Reward-wise normalization, as used in GDPO, preserves rew…
cs.LG2026
UOPD: Uncertainty-Aware Intervention for On-Policy Distillation of Multi-Turn Agents
Wenbo Zhang, Pengcheng Xu, Weizhi Du +2
On-policy distillation (OPD) trains a student on its own rollouts using dense supervision from a teacher. In multi-turn environments, a mistake at a critical decision step can redi…