2 papers
cs.CL2026
From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization
Qianqi Yan, Huy Nguyen, Sumana Srivatsa +3
Deploying multimodal large language models (MLLMs) for clinical summarization demands not only fluent generation but also transparency about where each statement originates-and a m…
cs.CL2026
Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation
Abir Harrasse, Chaithanya Bandi, Hari Bandi
The evaluation of Large Language Models (LLMs) remains challenging due to inconsistency, bias, and the absence of transparent decision criteria in automated judging. We present Deb…