2 papers
cs.CV2025
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
Haoyang He, Jie Wang, Jiangning Zhang +5
The quality and diversity of instruction-based image editing datasets are continuously increasing, yet large-scale, high-quality datasets for instruction-based video editing remain…
cs.CV2025
JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
Xiaohu Huang, Hao Zhou, Haoyang He +3
In this paper, we present JoVA, a streamlined framework that unifies joint video-audio generation and editing. While existing methods often rely on fragmented, task-specific archit…