1 paper · 1 filter
Zhepei Wei, Xinyu Zhu, Wei-Lin Chen +3
Reinforcement learning with verifiable rewards (RLVR) has become a dominant paradigm for improving reasoning in large language models (LLMs), yet the underlying geometry of the res…