From the 1 of 11 linked papers with an AI index.
7 papers · 1 filter
Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models
Mingyang Sun, Jiude Wei, Xiujian Liang +4
The paper introduces a Concept Expert module that extracts 3D kinematic and structural information to create Analytic Concepts, providing explicit guidance for Vision-Language-Acti…
Analytic Concept-Centric Memory for Agentic Embodied Manipulation
Mingyang Sun, Xiujian Liang, Jiude Wei +4
Long-horizon embodied manipulation requires agents to remember persistent objects, track changing scene states, and reuse prior interaction knowledge. However, existing agent memor…
Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation
Mingyang Sun, Jiude Wei, Qichen He +3
Enabling robots to perform precise and generalized manipulation in unstructured environments remains a fundamental challenge in embodied AI. While Vision-Language Models (VLMs) hav…
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
Hengtao Li, Pengxiang Ding, Runze Suo +8
Vision-Language-Action (VLA) models enable embodied decision-making but rely heavily on imitation learning, leading to compounding errors and poor robustness under distribution shi…
CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction
Zhefei Gong, Pengxiang Ding, Shangke Lyu +5
In robotic visuomotor policy learning, diffusion-based models have achieved significant success in improving the accuracy of action trajectory generation compared to traditional au…
QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning
Xinyang Tong, Pengxiang Ding, Yiguo Fan +9
This paper addresses the inherent inference latency challenges associated with deploying multimodal large language models (MLLM) in quadruped vision-language-action (QUAR-VLA) task…