1 paper · 1 filter
Chaoyang Zhou, Shunyu Liu, Zengmao Wang +4
Reward models are critical for improving large language models (LLMs), particularly in reinforcement learning from human feedback (RLHF) or inference-time verification. Current rew…