4 papers · 1 filter
IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training
Rongze Tang, Jianjie Fang, Zhaolu Wang +8
World models have made remarkable progress in action-conditioned future prediction for embodied agents, yet still struggle to model physically plausible interactions. Existing appr…
CAER: Causal Action Effect Reweighting for World Model Training
Jianjie Fang, Xvyuan Liu, Ziyou Wang +9
World models are becoming core infrastructure for embodied intelligence, with action-conditioned video generation providing controllable predictions of how scenes evolve after agen…
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
Baining Zhao, Ziyou Wang, Jianjie Fang +8
Large multimodal models (LMMs) show strong visual-linguistic reasoning but their capacity for spatial decision-making and action remains unclear. In this work, we investigate wheth…
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
Baining Zhao, Ziyou Wang, Jianjie Fang +7
Humans can perceive and reason about spatial relationships from sequential visual observations, such as egocentric video streams. However, how pretrained models acquire such abilit…