1 paper · 1 filter
Sen Wang, R. Gnana Praveen, Bidhan Roy +1
Many recent robot policies pursue stronger control by using large pretrained vision-language models (VLMs) as the action backbone. We introduce WorldDiT, a unified diffusion transf…