1 paper
Shyam Sundhar Ramesh, Yifan Hu, Iason Chaimalas +4
Adapting large language models (LLMs) for specific tasks usually involves fine-tuning through reinforcement learning with human feedback (RLHF) on preference data. While these data…