1 paper
Weijie Zhu, Han Fang, Hanyu Fu +13
While reinforcement learning with verifiable rewards provides reliable outcome supervision for VideoLLMs, sequence-level rewards offer limited token-level guidance. On-policy self-…