1 paper
Qiaobo Hao, Yangqian Wu, Shunyi Wang +5
Post-training alignment determines the reasoning and human preference following capabilities of large language models, yet most existing works withhold detailed data construction,…