1 paper · 1 filter
Abdelaziz Bounhar, Hadi Abdine, Evan Dufraisse +5
Large language models (LLMs) trained for step-by-step reasoning often become excessively verbose, raising inference cost. Standard Reinforcement Learning with Verifiable Rewards (R…