1 paper · 1 filter
Asher J. Hancock, Xindi Wu, Lihan Zha +2
Fine-tuning vision-language models (VLMs) on robot teleoperation data to create vision-language-action (VLA) models is a promising paradigm for training generalist policies, but it…