14 citations · 14 across the 2 of their papers we have counts for
3 papers
cs.CV2026
Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization
Jiayu Xiong, Jing Wang, Qi Zhang +2
Audio-visual deepfake localization demands interval-level outputs that serve as temporal evidence. Despite recent progress, symmetric fusion under single-sided or asynchronous forg…
cs.CV2025
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
Yuxin Song, Wenkai Dong, Shizun Wang +8
Unified Multimodal Models (UMMs) have demonstrated remarkable performance in text-to-image generation (T2I) and editing (TI2I), whether instantiated as assembled unified frameworks…
cs.CV2023★ 14 cited
VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation
Xin Li, Wenqing Chu, Ye Wu +7
In this paper, we present VideoGen, a text-to-video generation approach, which can generate a high-definition video with high frame fidelity and strong temporal consistency using r…