works on

From the 1 of 11 linked papers with an AI index.

most citedThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter

4 citations · 4 across the 7 of their papers we have counts for

collaborators
Showing cs.ROShow all

9 papers · 1 filter

cs.RO2026

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

Yu Qi, Zhang Ye, Xinyi Xu +6

Compositional generalization is essential for robot to follow diverse instructions. However, pretrained policies are known to take shortcuts, deferring to salient cues rather than…

cs.RO2026

Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation

Haojie Huang, Linfeng Zhao, Haotian Liu +9

Pix2Act is an imitation‑learning approach that predicts continuous 2D keypoint trajectories in camera images and recovers 3D end‑effector poses via triangulation, using equivariant…

cs.RO2026

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

Haojie Huang, Zhang Ye, Linfeng Zhao +7

The action space poses a major challenge in robot learning, since it is often high-dimensional, can span long time horizons, and frequently admits multi-modal optimal solutions. A…

cs.RO2026

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

Zezhong Qian, Xiaowei Chi, Yu Qi +3

Recent World-Action (WA) models demonstrate strong generalization ability and data efficiency, but they typically rely on expert trajectories for training. This reliance limits the…

cs.RO20264 cited

ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter

Yaoyao Qian, Xupeng Zhu, Ondrej Biza +5

Robotic grasping in cluttered environments remains a significant challenge due to occlusions and complex object arrangements. We have developed ThinkGrasp, a plug-and-play vision-l…

cs.RO2025

Residual Rotation Correction using Tactile Equivariance

Yizhe Zhu, Zhang Ye, Boce Hu +4

Visuotactile policy learning augments vision-only policies with tactile input, facilitating contact-rich manipulation. However, the high cost of tactile data collection makes sampl…