1 paper
Jared Joselowitz, Ritam Majumdar, Arjun Jagota +4
Large language models (LLMs) trained with Reinforcement Learning from Human Feedback (RLHF) have demonstrated remarkable capabilities, but their underlying reward functions and dec…