1 paper
Javier Alejandro Lopetegui Gonzalez, Paul Pacaud, Cordelia Schmid
World Action Models (WAMs) leverage the capabilities of large-scale pretrained video diffusion models to jointly predict future observations and actions, inheriting rich visual and…