1 paper · 1 filter
Qingyu Yin, Yulun Wu, Zhennan Shen +6
We systematically evaluate Parameter-Efficient Fine-Tuning (PEFT) methods under the paradigm of Reinforcement Learning with Verifiable Rewards (RLVR). RLVR incentivizes language mo…