3 papers
cs.LG2026
LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment
Shipeng Li, Zhiqin Yang, Shikun Li +7
Reinforcement learning with verifiable rewards (RLVR) has become a key technique for enhancing LLMs' reasoning abilities, yet its data inefficiency remains a major bottleneck. To a…
cs.LG2026
Generalizable Multimodal Large Language Model Editing via Invariant Trajectory Learning
Jiajie Su, Haoyuan Wang, Xiaohua Feng +6
Knowledge editing emerges as a crucial technique for efficiently correcting incorrect or outdated knowledge in large language models (LLM). Existing editing methods rely on a rigid…
cs.LG2025
Potent but Stealthy: Rethink Profile Pollution against Sequential Recommendation via Bi-level Constrained Reinforcement Paradigm
Jiajie Su, Zihan Nan, Yunshan Ma +6
Sequential Recommenders, which exploit dynamic user intents through interaction sequences, is vulnerable to adversarial attacks. While existing attacks primarily rely on data poiso…