2 papers
cs.CV2026
DanceOPD: On-Policy Generative Field Distillation
Wei Zhou, Xiongwei Zhu, Zelin Xu +8
Modern image generation demands a single model that unifies diverse capabilities, including text-to-image (T2I), local editing, and global editing. However, these capabilities are…
cs.CV2026
LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving
Chen Yang, Yuhao Wei, Ze Xu +6
Vision-Language Models (VLMs) provide powerful semantic understanding and commonsense reasoning for End-to-End Autonomous Driving (E2E-AD) planning. However, trajectories directly…