2 papers
cs.CV2026
Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation
Jiachen Li, Hongyun Wang, Jinyu Xu +5
Referring image segmentation aims to localize and segment a target object in an image based on a free-form referring expression. The core challenge lies in effectively bridging lin…
cs.CL2025
GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning
Liangyu Xu, Yingxiu Zhao, Jingyun Wang +9
Geometry problem-solving (GPS), a challenging task requiring both visual comprehension and symbolic reasoning, effectively measures the reasoning capabilities of multimodal large l…