1 paper
Jewon Yeom, Hanseul Kim, Jeongjae Park +3
Video world models are increasingly used to provide predictive visual representations, yet it remains unclear which pretraining signals induce action-relevant structure in their la…