2 papers
cs.LG2026
OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization
Kavin Aravindan, Arihant Rastogi, Aadi Prasad +4
Activation steering provides a lightweight mechanism for controlling large language models at inference time, but steering vectors can have unintended externalities: utility vector…
cs.CL2025
What if I ask in \textit{alia lingua}? Measuring Functional Similarity Across Languages
Debangan Mishra, Arihant Rastogi, Agyeya Negi +2
How similar are model outputs across languages? In this work, we study this question using a recently proposed model similarity metric applied to 20 languages and 47 subject…