1 paper · 1 filter
Hui Wu, Hengyi Cai, Jinman Zhao +6
Preference-based alignment is pivotal for training large reasoning models; however, standard methods like Direct Preference Optimization (DPO) typically treat all preference pairs…