1 paper
Yanzhao Guo, Wenkai Chen, Jianwei Zhang
Diffusion-based Vision-Language-Action (VLA) policies have demonstrated strong capability in modeling expressive and multimodal action distributions. However, their reliance on ite…