2 citations · 2 across the 3 of their papers we have counts for
1 paper · 1 filter
Yilei Chen, Souradip Chakraborty, Lorenz Wolf +2
Reinforcement learning (RL) has emerged as a popular method for post-training large language models (LLMs). While improving the model's performance on downstream tasks, it often re…