Showing cs.CVShow all
2 papers · 1 filter
cs.CV2025
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
Chun Wang, Xiaojun Ye, Xiaoran Pan +3
Recent advances in Visual Language Models (VLMs) have demonstrated exceptional performance in visual reasoning tasks. However, geo-localization presents unique challenges, requirin…
cs.CV2025
FocusedAD: Character-centric Movie Audio Description
Xiaojun Ye, Chun Wang, Yiren Song +3
Movie Audio Description (AD) aims to narrate visual content during dialogue-free segments, particularly benefiting blind and visually impaired (BVI) audiences. Compared with genera…