1 paper
Xiangkun Hu, Lemin Kong, Tong He +1
The generated responses of large language models (LLMs) are often fine-tuned to human preferences through a process called reinforcement learning from human feedback (RLHF). As RLH…