3 papers
cs.AI2026
From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM
Ruijie Yang, Yan Zhu, Peiyao Fu +7
Reliable endoscopic polyp reporting requires integrating quantitative lesion sizing, standardized Paris classification, and clinically meaningful morphological description within a…
cs.CL2026
Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs
Yihang Du, Juhao Liang, Zhengzhao Lai +2
Multimodal large language models (MLLMs) exhibit substantial performance degradation in non-English visual reasoning, despite the strong multilingual competence of their text-only…
cs.AI2026
A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports
Jia Yu, Yan Zhu, Yili He +12
Vision-language models remain underused in colonoscopy despite the rich expert descriptions recorded in routine reports. These reports document lesion appearance, size and location…