1 paper
Junlin Wu, Jiongxiao Wang, Chaowei Xiao +3
Learning reward models from pairwise comparisons is a fundamental component in a number of domains, including autonomous control, conversational agents, and recommendation systems,…