2 papers
cs.CV2026
Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization
Xuancheng Xu, Gengyun Jia, Bing-Kun Bao
Video customization based on Text-to-Video (T2V) models aims to learn specific features from reference data to generate controllable videos. While significant strides have been mad…
cs.CV2025
Causal Debiasing for Visual Commonsense Reasoning
Jiayi Zou, Gengyun Jia, Bing-Kun Bao
Visual Commonsense Reasoning (VCR) refers to answering questions and providing explanations based on images. While existing methods achieve high prediction accuracy, they often ove…