2 papers
cs.CL2026
AprielGuard
Jaykumar Kasundra, Anjaneya Praharaj, Sourabh Surana +11
Safeguarding large language models (LLMs) against unsafe or adversarial behavior is critical as they are increasingly deployed in conversational and agentic settings. Existing mode…
cs.CL2025
Token-Level Marginalization for Multi-Label LLM Classifiers
Anjaneya Praharaj, Jaykumar Kasundra
This paper addresses the critical challenge of deriving interpretable confidence scores from generative language models (LLMs) when applied to multi-label content safety classifica…