1 paper · 1 filter
Keliang Liu, Dingkang Yang, Ziyun Qian +7
In recent years, training methods centered on Reinforcement Learning (RL) have markedly enhanced the reasoning and alignment performance of Large Language Models (LLMs), particular…