1 paper
Jingchu Gai, Guanning Zeng, Huaqing Zhang +1
It is widely recognized that reinforcement learning (RL) fine-tuning of large language models often leads to diversity collapse, where outputs lack variety. Prior work has proposed…