1 paper · 1 filter
Qian Cao, Yahui Liu, Wei Bi +6
Reinforcement learning (RL)-based enhancement of large language models (LLMs) often leads to reduced output diversity, undermining their utility in open-ended tasks like creative w…