Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
Kaisi Guan, Xihua Wang, Zhengfeng Lai +5
This study focuses on a challenging yet promising task, Text-to-Sounding-Video (T2SV) generation, which aims to generate a video with synchronized audio from text conditions, meanw…
cs.CV2026
SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning
Xin Cheng, Xihua Wang, Ying Ba +5
Recent advancements in video-audio joint generation have achieved remarkable success in semantic correspondence. However, achieving precise temporal synchronization, which requires…