Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization
Xuancheng Xu, Gengyun Jia, Bing-Kun Bao
Video customization based on Text-to-Video (T2V) models aims to learn specific features from reference data to generate controllable videos. While significant strides have been mad…
cs.CV2025
Causal Debiasing for Visual Commonsense Reasoning
Jiayi Zou, Gengyun Jia, Bing-Kun Bao
Visual Commonsense Reasoning (VCR) refers to answering questions and providing explanations based on images. While existing methods achieve high prediction accuracy, they often ove…
cs.CV2024
Latte: Latent Diffusion Transformer for Video Generation
Xin Ma, Yaohui Wang, Xinyuan Chen +5
We propose Latte, a novel Latent Diffusion Transformer for video generation. Latte first extracts spatio-temporal tokens from input videos and then adopts a series of Transformer b…