2 papers
cs.CV2026
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
Minghong Cai, Qiulin Wang, Zongli Ye +7
Existing controllable video generation methods are typically designed for rigid, task-specific settings, such as first-frame image-to-video, inpainting, or interpolation, treating…
cs.LG2026
Asymmetric Hierarchical Anchoring for Robust Audio-Visual Cross-Modal Generalization
Bixing Wu, Yuhong Zhao, Zongli Ye +3
Audio-visual joint representation learning under Cross-Modal Generalization (CMG) aims to transfer knowledge from a labeled source modality to an unlabeled target modality through…