1 paper · 1 filter
Xu Guo, Tianyi Liang, Tong Jian +6
Reinforcement Learning with Verifiable Rewards (RLVR) improves instruction following capabilities of large language models (LLMs), but suffers from training inefficiency due to ina…