5 papers
Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models
S Divakar Bhat, Toshihiko Yamasaki
Spatial reasoning is fundamental to robotics, autonomy, and embodied AI, yet modern vision-language models (VLMs) remain unreliable on metric distance queries. A common assumption…
E-SocialNav: Efficient Socially Compliant Navigation with Language Models
Ling Xiao, Daeun Song, Xuesu Xiao +1
Language models (LMs) are increasingly applied to robotic navigation; however, existing benchmarks primarily emphasize navigation success rates while paying limited attention to so…
Spectral Probing of Feature Upsamplers in 2D-to-3D Scene Reconstruction
Ling Xiao, Yuliang Xiu, Yue Chen +2
A typical 2D-to-3D pipeline takes multi-view images as input, where a Vision Foundation Model (VFM) extracts features that are spatially upsampled to dense representations for 3D r…
Probing Prompt Design for Socially Compliant Robot Navigation with Vision Language Models
Ling Xiao, Toshihiko Yamasaki
Language models are increasingly used for social robot navigation, yet existing benchmarks largely overlook principled prompt design for socially compliant behavior. This limitatio…
LLM-Advisor: An LLM Advisor for Cost-efficient Path Planning across Multiple Terrains
Ling Xiao, Toshihiko Yamasaki
This paper addresses fixed-graph terrain-aware path refinement, in which a global planner is restricted to a predefined route space and may remain optimal within that space while m…