4 papers
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
Chen Qian, Xinran Yu, Danyang Li +4
Visual token pruning is a promising approach for reducing the computational cost of vision-language models (VLMs), and existing methods often rely on early pruning decisions to imp…
edgeVLM: Cloud-edge Collaborative Real-time VLM based on Context Transfer
Chen Qian, Xinran Yu, Zewen Huang +6
Vision-Language Models (VLMs) are increasingly deployed in real-time applications such as autonomous driving and human-computer interaction, which demand fast and reliable response…
OpenMoCap: Rethinking Optical Motion Capture under Real-world Occlusion
Chen Qian, Danyang Li, Xinran Yu +2
Optical motion capture is a foundational technology driving advancements in cutting-edge fields such as virtual reality and film production. However, system performance suffers sev…
OpenMap: Instruction Grounding via Open-Vocabulary Visual-Language Mapping
Danyang Li, Zenghui Yang, Guangpeng Qi +4
Grounding natural language instructions to visual observations is fundamental for embodied agents operating in open-world environments. Recent advances in visual-language mapping h…