8 papers · 1 filter
EyeWorld: A Generative World Model of Ocular State and Dynamics
Ziyu Gao, Xinyuan Wu, Xiaolan Chen +10
Ophthalmic decision-making depends on subtle lesion-scale cues interpreted across multimodal imaging and over time, yet most medical foundation models remain static and degrade und…
APTOS-2024 challenge report: Generation of synthetic 3D OCT images from fundus photographs
Bowen Liu, Weiyi Zhang, Peranut Chotcomwongse +23
Optical Coherence Tomography (OCT) provides high-resolution, 3D, and non-invasive visualization of retinal layers in vivo, serving as a critical tool for lesion localization and di…
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
Pusheng Xu, Xia Gong, Xiaolan Chen +7
Purpose: To develop a bilingual multimodal visual question answering (VQA) benchmark for evaluating VLMs in ophthalmology. Methods: Ophthalmic image posts and associated captions p…
FFA Sora, video generation as fundus fluorescein angiography simulator
Xinyuan Wu, Lili Wang, Ruoyu Chen +6
Fundus fluorescein angiography (FFA) is critical for diagnosing retinal vascular diseases, but beginners often struggle with image interpretation. This study develops FFA Sora, a t…
Fundus to Fluorescein Angiography Video Generation as a Retinal Generative Foundation Model
Weiyi Zhang, Jiancheng Yang, Ruoyu Chen +7
Fundus fluorescein angiography (FFA) is crucial for diagnosing and monitoring retinal vascular issues but is limited by its invasive nature and restricted accessibility compared to…
EyeCLIP: A visual-language foundation model for multi-modal ophthalmic image analysis
Danli Shi, Weiyi Zhang, Jiancheng Yang +8
Early detection of eye diseases like glaucoma, macular degeneration, and diabetic retinopathy is crucial for preventing vision loss. While artificial intelligence (AI) foundation m…