1 paper · 1 filter
Wei Wu, Liyi Chen, Congxi Xiao +7
Large reasoning models enhanced by reinforcement learning with verifiable rewards have achieved significant performance gains by extending their chain-of-thought. However, this par…