From the 1 of 13 linked papers with an AI index.
Showing cs.AIShow all
2 papers · 1 filter
cs.AI2025
A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space
Bingjie Zhang, Yibo Yang, Zhe Ren +4
Large language models (LLMs) have achieved remarkable success in diverse tasks, yet their safety alignment remains fragile during adaptation. Even when fine-tuning on benign data o…
cs.AI2025
Purifying Task Vectors in Knowledge-Aware Subspace for Model Merging
Bang An, Yibo Yang, Philip Torr +1
Model merging aims to integrate task-specific abilities from individually fine-tuned models into a single model without extra training. In recent model merging methods, task vector…