2 papers
cs.CV2026
BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning
Jiacheng Yang, Tongying Xiao, Yunkai Dang +7
Current Vision-Language Models (VLMs) often struggle to handle complex visual tasks that require consistent and fine-grained reasoning. Recent methods aim to train models to facili…
cs.RO2026
UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models
Lin Sun, Zhiwei Guan, Conglin Wang +7
Mainstream Fast-Slow dual system vision-language-action models decouple a high-frequency action expert from a low-frequency vision-language model for efficiency, yet they face a fu…