1 paper
Kevin Kingslin, Anish Natekar, Ashutosh Ranjan +3
Preference-based alignment often struggles to capture the reasoning that underlies human judgments. Many evaluations rely on multiple interacting criteria, yet pairwise labels reve…