Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding
Yuefei Chen, Jiang Liu, Xiaodong Lin +1
Vision Language Models (VLMs) have recently shown significant advancements in video understanding, especially in feature alignment, event reasoning, and instruction-following tasks…
cs.CV2024
CompoNeRF: Text-guided Multi-object Compositional NeRF with Editable 3D Scene Layout
Haotian Bai, Yuanhuiyi Lyu, Lutao Jiang +4
Text-to-3D form plays a crucial role in creating editable 3D scenes for AR/VR. Recent advances have shown promise in merging neural radiance fields (NeRFs) with pre-trained diffusi…