3 papers
cs.CV2025
S2AFormer: Strip Self-Attention for Efficient Vision Transformer
Guoan Xu, Wenfeng Huang, Wenjing Jia +3
Vision Transformer (ViT) has made significant advancements in computer vision, thanks to its token mixer's sophisticated ability to capture global dependencies between all tokens.…
cs.CV2025
Unsupervised Monocular Depth Estimation Based on Hierarchical Feature-Guided Diffusion
Runze Liu, Dongchen Zhu, Guanghui Zhang +5
Unsupervised monocular depth estimation has received widespread attention because of its capability to train without ground truth. In real-world scenarios, the images may be blurry…
cs.RO2024
Fast Extrinsic Calibration for Multiple Inertial Measurement Units in Visual-Inertial System
Youwei Yu, Yanqing Liu, Fengjie Fu +5
In this paper, we propose a fast extrinsic calibration method for fusing multiple inertial measurement units (MIMU) to improve visual-inertial odometry (VIO) localization accuracy.…