1 paper
Yuzhou Liu, Xiyang Hu
Preference optimization improves mathematical reasoning in large language models (LLMs), but reliable chosen-rejected pairs usually require verified answers, human annotations, or…