1 paper · 1 filter
Ziyan Liu, Xueda Shen, Yuzhe Gu +7
Large Reasoning Models (LRMs) have achieved remarkable progress thanks to Reinforcement Learning with Verifiable Rewards (RLVR) on Chain-of-Thoughts (CoTs). However, since long CoT…