1 paper
Jian Hong, Chen Cheng, Quan Liu +2
Following complex instructions with multiple explicit constraints remains a fundamental challenge for large language models (LLMs). Existing alignment methods, such as DPO, optimiz…