15 citations · 50 across the 17 of their papers we have counts for
14 papers · 1 filter
GaussianSeed: Hierarchical Gaussian Seeding for High-Resolution 3D Occupancy Prediction
Xinzhuo Li, Xianghui Pan, Jiayuan Du +4
Vision-centric 3D occupancy prediction provides dense scene representations essential for autonomous driving and robotic navigation, yet existing methods struggle to scale to high…
MemPose: Category-level Object Pose Estimation with Memory
Xiao Lin, Minghao Zhu, Yun Peng +4
In the pursuit of robust and generalizable category-level object pose estimation, most existing methods adopt parametric formulations that learn effective representations from data…
TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition
Minghao Zhu, Xiao Lin, Mengxian Hu +5
Adapting CLIP for open-vocabulary video recognition necessitates a delicate balance between newly acquired video knowledge and the pretrained generalization. While existing studies…
P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
Kai Sheng, Liuyi Wang, Haojie Dai +5
Vision-and-language navigation (VLN) requires an embodied agent to ground natural-language instructions into executable navigation actions in unseen environments. Existing zero-sho…
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
Rong Fan, Kaiyan Xiao, Minghao Zhu +3
Video temporal grounding (VTG) is a critical task in video understanding and a key capability for extending video large language models (Vid-LLMs) to broader applications. However,…
Temporal-Guided Visual Foundation Models for Event-Based Vision
Ruihao Xia, Junhong Cai, Luziwei Leng +5
Event cameras offer unique advantages for vision tasks in challenging environments, yet processing asynchronous event streams remains an open challenge. While existing methods rely…