collaborators

5 papers

cs.CV2026

Video as Natural Augmentation: Towards Unified AI-Generated Image and Video Detection

Zhengcen Li, Chenyang Jiang, Liangxu Su +4

AI-generated content (AIGC) is rapidly improving, creating an urgent need for detectors that generalize across data sources, deployment pipelines, and visual modalities. A strongly…

cs.CV2026

Consistency Beyond Contrast: Enhancing Open-Vocabulary Object Detection Robustness via Contextual Consistency Learning

Bozhao Li, Shaocong Wu, Tong Shao +4

Recent advances in open-vocabulary object detection focus primarily on two aspects: scaling up datasets and leveraging contrastive learning to align language and vision modalities.…

cs.CV2026

SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer

Tong Shao, Yusen Fu, Guoying Sun +3

Diffusion Transformers have become a dominant paradigm in visual generation, yet their low inference efficiency remains a key bottleneck hindering further advancement. Among common…

cs.CV2026

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

Tong Shao, Yusen Fu, Guoying Sun +3

Although Diffusion Transformer (DiT) has emerged as a predominant architecture for image and video generation, its iterative denoising process results in slow inference, which hind…

cs.CV2025

Binarized Mamba-Transformer for Lightweight Quad Bayer HybridEVS Demosaicing

Shiyang Zhou, Haijin Zeng, Yunfan Lu +5

Quad Bayer demosaicing is the central challenge for enabling the widespread application of Hybrid Event-based Vision Sensors (HybridEVS). Although existing learning-based methods t…