5 papers · 1 filter
Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models
Jiayu Ding, Zhuodong Liu, Lei Zhang +6
As Vision-Language Models (VLMs) tackle dynamic 3D spatial reasoning, ego-motion perception becomes essential to resolve monocular scale ambiguity. However, current models often ov…
Text-Vision Co-Instructed Image Editing
Chenxi Xie, Yuhui Wu, Qiaosi Yi +1
Existing image editing methods can be generally categorized into textual instruction-based and visual prompt-based ones. Textual instructions are semantically expressive, but are l…
Omni-3DEdit: Generalized Versatile 3D Editing in One-Pass
Chen Liyi, Wang Pengfei, Zhang Guowen +2
Most instruction-driven 3D editing methods rely on 2D models to guide the explicit and iterative optimization of 3D representations. This paradigm, however, suffers from two primar…
ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning
Changti Wu, Jiahuai Mao, Yuzhuo Miao +6
Large-scale Visual Instruction Tuning (VIT) has become a key paradigm for advancing the performance of vision-language models (VLMs) across various multimodal tasks. However, train…
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
Shijie Lian, Changti Wu, Laurence Tianruo Yang +4
Spatial intelligence spans a rich suite of abilities, including visualising and transforming shapes, mentally rotating objects, judging relational positions and containment, and es…