3 papers
cs.CV2026
Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA
Zhou Du, Hamid Krim, Xiao Wu +3
Recent advances in video multimodal models have significantly improved VideoQA performance. However, these systems often rely on spurious statistical correlations rather than answe…
cs.CV2026
Disentanglement-Based Equivariant Learning for Compositional VQA
Zhou Du, Zhaoquan Yuan, Xiao Wu +1
Compositional visual question answering (VQA) represents a challenging yet fundamental task that requires models to comprehend novel combinations of previously learned concepts. Th…
cs.CV2019
Adversarial Multimodal Network for Movie Question Answering
Zhaoquan Yuan, Siyuan Sun, Lixin Duan +2
Visual question answering by using information from multiple modalities has attracted more and more attention in recent years. However, it is a very challenging task, as the visual…