From the 1 of 6 linked papers with an AI index.
6 papers
VersaQ-3D: Architecture Support for Visual Geometry Grounded Transformers via Versatile Quantization
Yipu Zhang, Jintao Cheng, Xingyu Liu +8
The paper introduces VersaQ-3D, a co-designed quantization algorithm and reconfigurable accelerator that enables low‑bit (4‑bit) inference of Visual Geometry Grounded Transformers…
Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer
Yipu Zhang, Jintao Cheng, Weilun Feng +5
Feed-forward 3D reconstruction models, represented by Visual Geometry Grounded Transformer (VGGT), jointly predict multiple visual geometry tasks such as depth estimation, camera p…
Beyond First-Order: Learning Riemannian Geometries for Invariant Visual Place Recognition
Jintao Cheng, Weibin Li, Zhijian He +3
Visual Place Recognition (VPR) demands representations robust to drastic environmental and viewpoint shifts. Existing aggregation paradigms either depend on extensive supervised tr…
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
Jintao Cheng, Haozhe Wang, Weibin Li +7
Vision-Language-Action (VLA) models have rapidly advanced embodied intelligence, enabling robots to execute complex, instruction-driven tasks. However, as model capacity and visual…
Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
Jintao Cheng, Weibin Li, Jiehao Luo +5
Visual Place Recognition (VPR) has evolved from handcrafted descriptors to deep learning approaches, yet significant challenges remain. Current approaches, including Vision Foundat…
A Pseudo Global Fusion Paradigm-Based Cross-View Network for LiDAR-Based Place Recognition
Jintao Cheng, Jiehao Luo, Xieyuanli Chen +4
LiDAR-based Place Recognition (LPR) remains a critical task in Embodied Artificial Intelligence (AI) and Autonomous Driving, primarily addressing localization challenges in GPS-den…