4 papers
VFEM: Visual Feature Empowered Multivariate Time Series Forecasting with Cross-Modal Fusion
Yanlong Wang, Hang Yu, Jian Xu +7
Large time series foundation models often adopt channel-independent architectures to handle varying data dimensions, but this design ignores crucial cross-channel dependencies. Mea…
MetaWorld: Skill Transfer and Composition in a Hierarchical World Model for Grounding High-Level Instructions
Yutong Shen, Hangxu Liu, Kailin Pei +2
Humanoid robot loco-manipulation remains constrained by the semantic-physical gap. Current methods face three limitations: Low sample efficiency in reinforcement learning, poor gen…
PMMD: A pose-guided multi-view multi-modal diffusion for person generation
Ziyu Shang, Haoran Liu, Rongchao Zhang +2
Generating consistent human images with controllable pose and appearance is essential for applications in virtual try on, image editing, and digital human creation. Current methods…
DETACH: Cross-domain Learning for Long-Horizon Tasks via Mixture of Disentangled Experts
Yutong Shen, Hangxu Liu, Lei Zhang +4
Long-Horizon (LH) tasks in Human-Scene Interaction (HSI) are complex multi-step tasks that require continuous planning, sequential decision-making, and extended execution across do…