1 paper · 1 filter
Mingxuan Yan, Yuping Wang, Zechun Liu +1
To tackle long-horizon tasks, recent hierarchical vision-language-action (VLAs) frameworks employ vision-language model (VLM)-based planners to decompose complex manipulation tasks…