2 papers
cs.CL2026
SHARD: Safe and Helpful Alignment via Self-Reframing Distillation
Viswonathan Manoranjan, Amogh Gupta, Anvesh Rao Vijjini +2
Large language models often struggle with sensitive prompts. They may refuse outright, provide generic safety boilerplate, or fail to address the user's legitimate informational ne…
cs.MA2026
When Identity Overrides Incentives: Representational Choices as Governance Decisions in Multi-Agent LLM Systems
Viswonathan Manoranjan, Snehalkumar `Neil' S. Gaikwad
Multi-agent systems built on large language models are increasingly deployed in strategic policy and governance settings, where agents representing stakeholders with conflicting in…