9 papers
On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos
Darakshan Rashid, Raza Imam, Ufaq Khan +9
Temporal vision-language models (TVLMs) offer a reusable, prompt-based interface for surgical video understanding, yet, their robustness under clinically realistic acquisition arti…
Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs
Raza Imam, Darakshan Rashid, Yutong Xie +3
Medical vision-language models (MVLMs) promise broad zero-shot generalization, yet their reliability collapses when confronted with unseen modalities and domains, precisely where c…
MeDxAgent: Multi-Agent Consultation for Interactive Medical Diagnosis
Akshat Sanghvi, Naren Akash, Raza Imam +2
Large language models (LLMs) are increasingly used for health-related decision support. Yet most evaluations treat diagnosis as a single-shot task with complete information provide…
Stride-Net: Fairness-Aware Disentangled Representation Learning for Chest X-Ray Diagnosis
Darakshan Rashid, Raza Imam, Dwarikanath Mahapatra +1
Deep neural networks for chest X-ray classification achieve strong average performance, yet often underperform for specific demographic subgroups, raising critical concerns about c…
T3: Test-Time Model Merging in VLMs for Zero-Shot Medical Imaging Analysis
Raza Imam, Hu Wang, Dwarikanath Mahapatra +1
In medical imaging, vision-language models face a critical duality: pretrained networks offer broad robustness but lack subtle, modality-specific characteristics, while fine-tuned…
Decoupling Clinical and Class-Agnostic Features for Reliable Few-Shot Adaptation under Shift
Umaima Rahman, Raza Imam, Mohammad Yaqub +1
Medical vision-language models (VLMs) offer promise for clinical decision support, yet their reliability under distribution shifts remains a major concern for safe deployment. Thes…