3 papers
cs.CL2025
Attributional Safety Failures in Large Language Models under Code-Mixed Perturbations
Somnath Banerjee, Pratyush Chatterjee, Shanu Kumar +4
While LLMs appear robustly safety-aligned in English, we uncover a catastrophic, overlooked weakness: attributional collapse under code-mixed perturbations. Our systematic evaluati…
cs.CL2025
Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment
Somnath Banerjee, Sayan Layek, Pratyush Chatterjee +2
Ensuring consistent safety across multiple languages remains a significant challenge for large language models (LLMs). We introduce Soteria, a lightweight yet powerful strategy tha…
cs.CL2025
AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models
Sayantan Adak, Pratyush Chatterjee, Somnath Banerjee +3
Present day LLMs face the challenge of managing affordance-based safety risks-situations where outputs inadvertently facilitate harmful actions due to overlooked logical implicatio…