2 papers
cs.LG2026
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
Sijia Cui, Pengyu Cheng, Jiajun Song +6
Reinforcement Learning with Verifiable Rewards (RLVR) has significantly advanced the reasoning capacity of Large Language Models (LLMs). However, RLVR solely relies on final answer…
cs.LG2025
MUC: Machine Unlearning for Contrastive Learning with Black-box Evaluation
Yihan Wang, Yiwei Lu, Guojun Zhang +4
Machine unlearning offers effective solutions for revoking the influence of specific training data on pre-trained model parameters. While existing approaches address unlearning for…