1 paper
Cheonbok Park, Jeonghoon Kim, Joosung Lee +3
Reinforcement learning with verifiable reward (RLVR) has been instrumental in eliciting strong reasoning capabilities from large language models (LLMs) via long chains of thought (…