1 paper
Jiayi Chen, Wenxuan Song, Jiaxin Fang +13
Vision-Language-Action (VLA) models that encode actions using a discrete tokenization scheme have been widely adopted for robotic manipulation, but existing decoding paradigms rema…