reinforcement learning

Learning Implicit Causal World Models from Multi-Agent Demonstrations

arXiv:2607.26336

summary

The paper proposes Implicit Causal World Models that learn environmental dynamics from offline multi-agent demonstrations without predefined causal graphs, using policy variance and a sequential backdoor condition to capture causal representations.

Abstract

In model-based reinforcement learning, world models exist as internal simulators, but their training often conflates statistical correlations with causal mechanisms. This problem is exacerbated in multi-agent systems where physical transitions are intertwined with strategic agent intents, causing world models to fail under distribution shift. We introduce Implicit Causal World Models to recover environmental dynamics from offline demonstrations without requiring pre-defined causal graphs. By incorporating policy variance, we render world models discoverable via the sequential backdoor condition. Evaluations across coordination tasks (Two-Door, Navigation, and Giveway) demonstrate that these models provide interpretable causal representations under both full and partial observability, with model accuracy scaling directly with interventional strength.

Preprint

Topics & keywords

#multi-agent reinforcement learning#causal inference#world models#offline learning#coordination tasksimplicit causal world modelsequential backdoor conditionpolicy varianceoffline demonstrationscausal representation
Learning Implicit Causal World Models from Multi-Agent Demonstrations · wovepaper