activity
20242026
collaborators

5 papers

cs.CV2026

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

Weixin Ye, Wei Wang, Hongguang Zhu +1

Despite rapid advances in generative models, achieving pixel-level precision in sketch-based image editing remains a persistent challenge, particularly for fine-grained local defor…

cs.CV2026

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Xiaomeng Yang, Mengping Yang, Jia Gong +3

Recent advances in video generation have enabled thrilling experiences in producing realistic videos driven by scalable diffusion transformers. However, they usually fail to produc…

cs.CV2025

SPDiffusion: Semantic Protection Diffusion Models for Multi-concept Text-to-image Generation

Yang Zhang, Rui Zhang, Xuecheng Nie +6

Recent text-to-image models have achieved impressive results in generating high-quality images. However, when tasked with multi-concept generation creating images that contain mult…

cs.CV2024

Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation

Baisen Wang, Le Zhuo, Zhaokai Wang +7

Multimodal music generation aims to produce music from diverse input modalities, including text, videos, and images. Existing methods use a common embedding space for multimodal fu…

cs.CV2024

The SkatingVerse Workshop & Challenge: Methods and Results

Jian Zhao, Lei Jin, Jianshu Li +16

The SkatingVerse Workshop & Challenge aims to encourage research in developing novel and accurate methods for human action understanding. The SkatingVerse dataset used for the Skat…