4 papers · 1 filter
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
Pusheng Xu, Xia Gong, Xiaolan Chen +7
Purpose: To develop a bilingual multimodal visual question answering (VQA) benchmark for evaluating VLMs in ophthalmology. Methods: Ophthalmic image posts and associated captions p…
Fundus to Fluorescein Angiography Video Generation as a Retinal Generative Foundation Model
Weiyi Zhang, Jiancheng Yang, Ruoyu Chen +7
Fundus fluorescein angiography (FFA) is crucial for diagnosing and monitoring retinal vascular issues but is limited by its invasive nature and restricted accessibility compared to…
EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
Danli Shi, Weiyi Zhang, Jiancheng Yang +8
Early detection of eye diseases like glaucoma, macular degeneration, and diabetic retinopathy is crucial for preventing vision loss. While artificial intelligence (AI) foundation m…
EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging
Danli Shi, Weiyi Zhang, Xiaolan Chen +6
Artificial intelligence (AI) is vital in ophthalmology, tackling tasks like diagnosis, classification, and visual question answering (VQA). However, existing AI models in this doma…