2 papers
cs.CV2026
Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation
Boyuan Xiao, Bohong Chen, Yumeng Li +3
In embodied vision-language decision making tasks such as robotic manipulation and navigation, Vision-Language and Vision-Language-Action Models (VLMs & VLAs) are powerful tools wi…
cs.CV2026
Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction
Yichang Jian, Boyuan Xiao, Zhenyuan Huang +2
Planning from raw visual input remains a significant challenge for current Vision-Language Models (VLMs), when the complexity of input is beyond their one-step perception capabilit…