embodied ai 1lightweight architecture 1real-time inference 1robotic manipulation 1vision-language models 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.CV2026
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Hengyi Xie, Chenfei Yao, Xianjin Wu +7
TurboVLA is a vision-language-action model that directly maps visual observations and language instructions to robot actions, achieving real-time performance (32 Hz) on an RTX 4090…
cs.AI2025
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
Linger Deng, Linghao Zhu, Yuliang Liu +6
Large Multimodal Models (LMMs) face limitations in geometric reasoning due to insufficient Chain of Thought (CoT) image-text training data. While existing approaches leverage templ…
cs.CV2025
Generative Compositor for Few-Shot Visual Information Extraction
Zhibo Yang, Wei Hua, Sibo Song +4
Visual Information Extraction (VIE), aiming at extracting structured information from visually rich document images, plays a pivotal role in document processing. Considering variou…