2 papers
cs.AI2026
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
Zhiqin Yang, Yonggang Zhang, Wei Xue +3
Direct Preference Optimization (DPO) has emerged as a popular alternative to Reinforcement Learning from Human Feedback (RLHF), offering theoretical equivalence with simpler implem…
cs.LG2026
LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
Shipeng Li, Zhiqin Yang, Shikun Li +7
Reinforcement learning with verifiable rewards (RLVR) has become a key technique for enhancing LLMs' reasoning abilities, yet its data inefficiency remains a major bottleneck. To a…