1 paper
Ruiming Liang, Yi Zhong, Yizhen Yuan +6
Modern large language models (LLMs) are expected not just to answer correctly, but to adapt their behavior to different human values and use cases. As a result, multi-reward reinfo…