1 paper
Hao Wang, Linlong Xu, Heng Liu +11
Aligning Large Language Models (LLMs) with human preferences is pivotal for Machine Translation (MT), yet current approaches are often hindered by misleading reward signals. Our an…