1 paper · 1 filter
Luoyang Sun, Guoyang Xia, Fengfa Li +9
Vision-Language-Action (VLA) models combine a pretrained vision encoder, a language backbone, and an action head, but their relative contribution has not been established under con…