2 papers
cs.CV2026
BindCLIP: One Balanced Coupling For Compositional Vision Language Scoring
Liuyang Song, Yi Zhang, Zhongyi Deng +2
Global vision--language similarities compress an image and a caption into one vector, preserving semantics but not which word corresponds to which region or how those regions are a…
cs.CV2026
Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models
Jiayu Ding, Zhuodong Liu, Lei Zhang +6
As Vision-Language Models (VLMs) tackle dynamic 3D spatial reasoning, ego-motion perception becomes essential to resolve monocular scale ambiguity. However, current models often ov…