3 papers
cs.CV2026
UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
Min Zhao, Hongzhou Zhu, Yingze Wang +6
Despite advances, video diffusion transformers still struggle to generalize beyond their training length, a challenge we term video length extrapolation. We identify two failure mo…
cs.CV2025
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
Min Zhao, Bokai Yan, Xue Yang +5
Recent image diffusion transformers achieve high-fidelity generation, but struggle to generate images beyond these scales, suffering from content repetition and quality degradation…
cs.RO2025
GundamQ: Multi-Scale Spatio-Temporal Representation Learning for Robust Robot Path Planning
Yutong Shen, Ruizhe Xia, Bokai Yan +4
In dynamic and uncertain environments, robotic path planning demands accurate spatiotemporal environment understanding combined with robust decision-making under partial observabil…