1 paper · 1 filter
Bochen Yang, Lianlei Shan
Current Vision-Language-Action (VLA) models face a trade-off between efficient action generation and explicit deliberation. Directly decoding actions from vision-language backbone…