1 paper
Wenli Li, Kai Zhao, Haoran Jiang +3
Vision-language models (VLMs) have been widely adopted for 3D question answering (3D QA). In typical pipelines, visual tokens extracted from multiple viewpoints are concatenated wi…