3 papers
cs.SD2026
From Hype to Insight: Rethinking Large Language Model Integration in Visual Speech Recognition
Rishabh Jain, Naomi Harte
Advances in self-supervised encoders have improved Visual Speech Recognition (VSR). Recent approaches integrating these encoders with LLM decoders improves transcription accuracy;…
cs.CL2025
A Super-Learner with Large Language Models for Medical Emergency Advising
Sergey K. Aityan, Abdolreza Mosaddegh, Rolando Herrero +12
Medical decision-support and advising systems are critical for emergency physicians to quickly and accurately assess patients' conditions and make diagnosis. Artificial Intelligenc…
cs.AI2025
Radiology's Last Exam (RadLE): Benchmarking Frontier Multimodal AI Against Human Experts and a Taxonomy of Visual Reasoning Errors in Radiology
Suvrankar Datta, Divya Buchireddygari, Lakshmi Vennela Chowdary Kaza +24
Generalist multimodal AI systems such as large language models (LLMs) and vision language models (VLMs) are increasingly accessed by clinicians and patients alike for medical image…