1 paper
Salman Rahman, Jingyan Shen, Anna Mordvina +3
Large language models have achieved significant reasoning improvements through reinforcement learning with verifiable rewards (RLVR). Yet as model capabilities grow, constructing h…