1 paper
Xingyuming Liu, Ruichun Ma, Heyu Guo +7
Humans naturally leverage diverse sensing modalities to interact with the physical world, while most Vision-Language-Action (VLA) models for robotics rely solely on RGB observation…