Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System
Kailin Lyu, Kangyi Wu, Pengna Li +9
LLM-based agents have demonstrated impressive zero-shot performance in vision-language navigation (VLN) tasks. However, most zero-shot methods primarily rely on closed-source LLMs…
cs.CV2024
EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients
Meihan Wu, Tao Chang, Cui Miao +5
Federated learning research has recently shifted from Convolutional Neural Networks (CNNs) to Vision Transformers (ViTs) due to their superior capacity. ViTs training demands highe…