8 papers
SAGE: Spatial-visual Adaptive Graph Exploration for Efficient Visual Place Recognition
Shunpeng Chen, Changwei Wang, Rongtao Xu +7
Visual Place Recognition (VPR) requires robust retrieval of geotagged images despite large appearance, viewpoint, and environmental variation. Prior methods focus on descriptor fin…
DeliCIR: Memory-Guided Test-Time Deliberation via Multi-Agent Collaboration for Composed Image Retrieval
Xingtian Pei, Yukun Song, Changwei Wang +4
Composed Image Retrieval (CIR) requires both preserving the visual continuity of the reference image and faithfully executing the semantic variables specified in the modification t…
DialogueVPR: Towards Conversational Visual Place Recognition
Yukun Song, Changwei Wang, Xingtian Pei +8
Inspired by how humans communicate spatial information, language-guided geo-localization has gained significant traction for its intuitive and practical value. Despite this progres…
Region Matters: Efficient and Reliable Region-Aware Visual Place Recognition
Shunpeng Chen, Yukun Song, Changwei Wang +6
Visual Place Recognition (VPR) determines a query image's geographic location by matching it against geotagged databases. However, existing methods struggle with perceptual aliasin…
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
Xiaofeng Han, Shunpeng Chen, Zenghuang Fu +9
Robot vision has greatly benefited from advancements in multimodal fusion techniques and vision-language models (VLMs). We adopt a task-oriented perspective to systematically revie…
CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion
Jinzhou Lin, Jie Zhou, Wenhao Xu +7
Semantic Scene Completion (SSC) aims to infer complete 3D geometry and semantics from monocular images, serving as a crucial capability for camera-based perception in autonomous dr…