1 paper
Meiling Ning, Zhongbao Zhang, Junda Ye +2
The emergence of LM-based judging reward modeling, represented by generative reward models, has successfully made reinforcement learning from AI feedback (RLAIF) efficient and scal…