1 paper · 1 filter
Noam Razin, Yong Lin, Jiarui Yao +1
Reward models are key to language model post-training and inference pipelines. Conveniently, recent work showed that every language model defines an implicit reward model (IM-RM),…