1 paper · 1 filter
Minghao Jin, Mozheng Liao, Mingfei Han +2
Recent world-model-based Vision-Language-Action (VLA) architectures have improved robotic manipulation through predictive visual foresight. However, dense future prediction introdu…