1 paper · 1 filter
Qiaobo Hao, Yangqian Wu, Shunyi Wang +5
Post-training alignment determines the reasoning and human preference following capabilities of large language models, yet most existing works withhold detailed data construction,…