7 papers
SCASeg: Strip Cross-Attention for Efficient Semantic Segmentation
Guoan Xu, Jiaming Chen, Wenfeng Huang +3
The Vision Transformer (ViT) has achieved notable success in computer vision, with its variants widely validated across various downstream tasks, including semantic segmentation. H…
RSGMamba: Reliability-Aware Self-Gated State Space Model for Multimodal Semantic Segmentation
Guoan Xu, Yang Xiao, Guangwei Gao +3
Multimodal semantic segmentation has emerged as a powerful paradigm for enhancing scene understanding by leveraging complementary information from multiple sensing modalities (e.g.…
S2AFormer: Strip Self-Attention for Efficient Vision Transformer
Guoan Xu, Wenfeng Huang, Wenjing Jia +3
Vision Transformer (ViT) has made significant advancements in computer vision, thanks to its token mixer's sophisticated ability to capture global dependencies between all tokens.…
ReviveDiff: A Universal Diffusion Model for Restoring Images in Adverse Weather Conditions
Wenfeng Huang, Guoan Xu, Wenjing Jia +2
Images captured in challenging environments--such as nighttime, smoke, rainy weather, and underwater--often suffer from significant degradation, resulting in a substantial loss of…
SAGS: Self-Adaptive Alias-Free Gaussian Splatting for Dynamic Surgical Endoscopic Reconstruction
Wenfeng Huang, Xiangyun Liao, Yinling Qian +4
Surgical reconstruction of dynamic tissues from endoscopic videos is a crucial technology in robot-assisted surgery. The development of Neural Radiance Fields (NeRFs) has greatly a…
Versatile and Efficient Medical Image Super-Resolution Via Frequency-Gated Mamba
Wenfeng Huang, Xiangyun Liao, Wei Cao +2
Medical image super-resolution (SR) is essential for enhancing diagnostic accuracy while reducing acquisition cost and scanning time. However, modeling both long-range anatomical s…