2 papers
cs.AI2026
A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models
Xiangyu Yin, Tora Bodin, Rohan Menon +1
Inference time defences against vision language model jailbreaks often subtract a calibrated direction from the residual stream at a chosen decoder layer. We compare five defence c…
cs.AI2026
Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration
Xiangyu Yin, Jiaxu Liu, Zhen Chen +1
Large language model unlearning is consistently fragile under relearn attacks. On TOFU, fine-tuning on twenty forget examples substantially recovers held-out forget-set ROUGE for e…