1 paper
Karim Galliamov, Ivan Titov, Ilya Pershin
Reinforcement Learning from Human Feedback (RLHF) aligns language models with human preferences but is computationally expensive. We explore two approaches that leverage human gaze…