1 paper
Mikhail Krasitskii, Alexander Gelbukh, Olga Kolesnikova +1
Reinforcement learning with human feedback (RLHF) aligns LLMs with human preferences, improving summarization fluency and safety, but causes sentiment drift: overly neutral summari…