works on

From the 1 of 11 linked papers with an AI index.

activity
20242026
collaborators
Showing cs.ROShow all

7 papers · 1 filter

cs.RO2026

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

Mingyang Sun, Jiude Wei, Xiujian Liang +4

The paper introduces a Concept Expert module that extracts 3D kinematic and structural information to create Analytic Concepts, providing explicit guidance for Vision-Language-Acti…

cs.RO2026

Analytic Concept-Centric Memory for Agentic Embodied Manipulation

Mingyang Sun, Xiujian Liang, Jiude Wei +4

Long-horizon embodied manipulation requires agents to remember persistent objects, track changing scene states, and reuse prior interaction knowledge. However, existing agent memor…

cs.RO2025

Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation

Mingyang Sun, Jiude Wei, Qichen He +3

Enabling robots to perform precise and generalized manipulation in unstructured environments remains a fundamental challenge in embodied AI. While Vision-Language Models (VLMs) hav…

cs.RO2025

VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators

Hengtao Li, Pengxiang Ding, Runze Suo +8

Vision-Language-Action (VLA) models enable embodied decision-making but rely heavily on imitation learning, leading to compounding errors and poor robustness under distribution shi…

cs.RO2025

CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction

Zhefei Gong, Pengxiang Ding, Shangke Lyu +5

In robotic visuomotor policy learning, diffusion-based models have achieved significant success in improving the accuracy of action trajectory generation compared to traditional au…

cs.RO2025

QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning

Xinyang Tong, Pengxiang Ding, Yiguo Fan +9

This paper addresses the inherent inference latency challenges associated with deploying multimodal large language models (MLLM) in quadruped vision-language-action (QUAR-VLA) task…