1 paper
Ziyi Ye, Xiangsheng Li, Qiuchi Li +5
Learning from preference feedback is a common practice for aligning large language models~(LLMs) with human value. Conventionally, preference data is learned and encoded into a sca…