1 paper · 1 filter
He Du, Bowen Li, Aijun Yang +3
Reliable verifiable data has become a key driver of capability gains in modern language models, enabling stable reinforcement learning with verifiable rewards and effective distill…