4 papers
MAS-OPD: On-Policy Distillation for Multi-agent Systems
Qiyong Zhong, Mao Zheng, Mingyang Song +5
Multi-agent systems (MAS) split a task across specialized roles and are promising on complex tasks, yet a prevailing approach relies on inference-time orchestration alone. General-…
USA: Update-aware SAM for Cross-domain On-Policy Disitllation of Language Agents
Qiyong Zhong, Mao Zheng, Mingyang Song +6
On-policy distillation instils multi-turn agentic reasoning through dense token-level supervision on the student's own trajectories, but a single domain saturates early, so further…
Sharpness-aware Model Merging with Salience Recovery for LLM-based Cross-Domain Sequential Recommendation
Huwei Ji, Jiajie Su, Yuyuan Li +2
LLM-based Cross-Domain Sequential Recommendation (CDSR) leverages LLMs to enhance target performance via deep semantic reasoning, alleviating the dependency on overlapping users. A…
Leveraging Machine Unlearning for Cost-Efficient Preference Alignment
Xiaohua Feng, Yuyuan Li, Huwei Ji +4
Despite advances in Preference Alignment (PA) for Large Language Models (LLMs), mainstream methods like reinforcement learning with human feedback face notable challenges. These ap…