activity
20242026
collaborators

5 papers

cs.CV2026

Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation

Chao Li, Tianhong Li, Sai Vidyaranya Nuthalapati +9

Unifying text-image contrastive learning and text-to-image (T2I) generation in a single end-to-end model is challenging because the two objectives demand opposing masking regimes:…

cs.CV2025

CoMo: Compositional Motion Customization for Text-to-Video Generation

Youcan Xu, Zhen Wang, Jiaxin Shi +6

While recent text-to-video models excel at generating diverse scenes, they struggle with precise motion control, particularly for complex, multi-subject motions. Although methods f…

cs.CR2025

TarPro: Targeted Protection against Malicious Image Editing

Kaixin Shen, Ruijie Quan, Jiaxu Miao +2

The rapid advancement of image editing techniques has raised concerns about their misuse for generating Not-Safe-for-Work (NSFW) content. This necessitates a targeted protection me…

cs.CV2025

IDPro: Flexible Interactive Video Object Segmentation by ID-queried Concurrent Propagation

Kexin Li, Tao Jiang, Zongxin Yang +3

Interactive Video Object Segmentation (iVOS) is a challenging task that requires real-time human-computer interaction. To improve the user experience, it is important to consider t…

cs.CV2024

Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation

Kexin Li, Zongxin Yang, Yi Yang +1

Audio-visual video segmentation (AVVS) aims to generate pixel-level maps of sound-producing objects that accurately align with the corresponding audio. However, existing methods of…