3 papers
cs.RO2025
ArtiBench and ArtiBrain: Benchmarking Generalizable Vision-Language Articulated Object Manipulation
Yuhan Wu, Tiantian Wei, Shuo Wang +4
Interactive articulated manipulation requires long-horizon, multi-step interactions with appliances while maintaining physical consistency. Existing vision-language and diffusion-b…
cs.CV2025
DreamForge: Motion-Aware Autoregressive Video Generation for Multi-View Driving Scenes
Jianbiao Mei, Tao Hu, Xuemeng Yang +7
Recent advances in diffusion models have improved controllable streetscape generation and supported downstream perception and planning tasks. However, challenges remain in accurate…
cs.AI2025
LeapVAD: A Leap in Autonomous Driving via Cognitive Perception and Dual-Process Thinking
Yukai Ma, Tiantian Wei, Naiting Zhong +6
While autonomous driving technology has made remarkable strides, data-driven approaches still struggle with complex scenarios due to their limited reasoning capabilities. Meanwhile…