1 paper
Hyuk Namgoong, Jeesu Jung, Sangkeun Jung +1
Recent advancements in large language models have heavily relied on the large reward model from reinforcement learning from human feedback for fine-tuning. However, the use of a si…