3 papers
cs.MA2025
CataractSurg-80K: Knowledge-Driven Benchmarking for Structured Reasoning in Ophthalmic Surgery Planning
Yang Meng, Zewen Pan, Yandi Lu +3
Cataract surgery remains one of the most widely performed and effective procedures for vision restoration. Effective surgical planning requires integrating diverse clinical examina…
cs.CL2025
Dolphin: A Large-Scale Automatic Speech Recognition Model for Eastern Languages
Yangyang Meng, Jinpeng Li, Guodong Lin +7
This report introduces Dolphin, a large-scale multilingual automatic speech recognition (ASR) model that extends the Whisper architecture to support a wider range of languages. Our…
cs.LG2025
Unity by Diversity: Improved Representation Learning in Multimodal VAEs
Thomas M. Sutter, Yang Meng, Andrea Agostini +5
Variational Autoencoders for multimodal data hold promise for many tasks in data analysis, such as representation learning, conditional generation, and imputation. Current architec…