1 paper
Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo +2
Reinforcement learning (RL) post-training improves the reasoning capabilities of large language models, but autoregressive rollout generation remains a major efficiency bottleneck.…