collaborators

6 papers

cs.CV2026

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Muyi Bao, Yuxin Cai, Hang Xu +7

Vision-language models (VLMs) have become a common foundation for vision-and-language navigation in continuous environments (VLN-CE). Yet most VLM-based methods cast navigation as…

cs.RO2026

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

Yuxin Cai, Zongtai Li, Maonan Wang +9

Object navigation requires a robot to search for an unobserved target in an unknown environment by deciding where to explore next under partial observability. Effective search rese…

cs.AI2025

NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities

Changyu Zeng, Yifan Wang, Zimu Wang +6

Recent advancements in 2D multimodal large language models (MLLMs) have significantly improved performance in vision-language tasks. However, extending these capabilities to 3D env…

cs.CV2025

FTCFormer: Fuzzy Token Clustering Transformer for Image Classification

Muyi Bao, Changyu Zeng, Yifan Wang +5

Transformer-based deep neural networks have achieved remarkable success across various computer vision tasks, largely attributed to their long-range self-attention mechanism and sc…

cs.CV2025

Vision Mamba in Remote Sensing: A Comprehensive Survey of Techniques, Applications and Outlook

Muyi Bao, Shuchang Lyu, Zhaoyang Xu +5

Deep learning has profoundly transformed remote sensing, yet prevailing architectures like Convolutional Neural Networks (CNNs) and Vision Transformers (ViTs) remain constrained by…

eess.IV2025

ASP-VMUNet: Atrous Shifted Parallel Vision Mamba U-Net for Skin Lesion Segmentation

Muyi Bao, Shuchang Lyu, Zhaoyang Xu +4

Skin lesion segmentation is a critical challenge in computer vision, and it is essential to separate pathological features from healthy skin for diagnostics accurately. Traditional…