1 paper · 1 filter
Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga +4
Vision-language-action (VLA) models inherit a shared synchronous clock from vision-language pretraining, processing every input at one rate. This is misaligned with physical intera…