2 papers
cs.CV2025
Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts
Qi Feng
While Multimodal Large Language Models (MLLMs) excel at general vision-language tasks, visuospatial cognition - reasoning about spatial layouts, relations, and dynamics - remains a…
cs.CV2025
Visuospatial Cognitive Assistant
Qi Feng
Video-based spatial cognition is vital for robotics and embodied AI but challenges current Vision-Language Models (VLMs). This paper makes two key contributions. First, we introduc…