1 paper · 1 filter
Pengyi Li, Matvey Skripkin, Alexander Zubrey +2
Large language models (LLMs) excel at reasoning, yet post-training remains critical for aligning their behavior with task goals. Existing reinforcement learning (RL) methods often…