21 papers
Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model
Haoning Yang, Xinyuan Chen, Yaohui Wang +1
Recently, diffusion models have made great progress in video generation. However, most existing video diffusion models are trained with short videos, and degrade when extrapolated…
Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming
Menglin Han, Yang Ding, Yulei Lu +6
Real-time long-form avatar audio-video generation requires causal, continuous synthesis while maintaining audiovisual synchronization and visual consistency. Adapting a pretrained…
DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking
Yunyi Li, Yu Qiao, Yaohui Wang +1
Video generation models achieve high visual quality but often struggle to generate physics-aware videos. Unlike rigid-body motion, which can be described by explicit trajectories o…
CausalMotion: Structured Physical Reasoning as Keyframe and Trajectory Guidance for Training-Free Video Generation
Sihan Zhuang, Xinyuan Chen, Tianfan Xue +1
Recent advances in diffusion-based video generation have significantly improved visual quality and short-term temporal coherence. However, existing methods still struggle to produc…
PARE: Pruning and Adaptive Routing for Efficient Video Generation
Yutong Wang, Yunke Wang, Tianfan Xue +4
Video Diffusion Transformers (DiTs) generate high-quality videos but demand substantial compute due to wide blocks, deep architectures, and iterative sampling. Recent methods reduc…
RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
Bingjie Gao, Qianli Ma, Xiaoxue Wu +9
Prompt design plays a crucial role in text-to-video (T2V) generation, yet user-provided prompts are often short, unstructured, and misaligned with training data, limiting the gener…