1 paper
Ali Abouzeid, Malak Mansour, Qinbo Sun +2
Vision-Language-Action (VLA) models often fail to generalize to unseen camera viewpoints, a limitation stemming from their difficulty in inferring robust 3D geometry from 2D images…