1 paper · 1 filter
Yao Zhou, Hang Gao, Fengge Wu +2
Outcome-driven reinforcement learning offers a scalable way to post-train vision-language-action (VLA) policies from sparse task-success feedback. In common GRPO-based VLA post-tra…