3 papers
cs.LG2026
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
Wen Wang, Jiahua Bao, Tu Yongsiqi +8
We aim to improve model performance in multi-reward reinforcement learning training process. Existing Group reward-Decoupled Normalization Policy Optimization (GDPO) has mitigated…
cs.CL2026
Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG
Haotian Zhou, Weiran Huang, Siqi Liu +3
Cross-lingual retrieval-augmented generation (RAG) is often deployed in an English-evidence regime, where users query in diverse languages but retrieved passages remain English. In…
cs.LG2024
DavIR: Data Selection via Implicit Reward for Large Language Models
Haotian Zhou, Tingkai Liu, Qianli Ma +5
We introduce DavIR, a model-based data selection method for post-training Large Language Models. DavIR generalizes Reducible Holdout Loss to core-set selection problem of causal la…