1 paper
Ziqian Wang, Rui Zhang, Yitian Liu +3
We propose Q-Guided Value-Gradient Matching (Q-VGM), an offline-to-online RL method for fine-tuning flow-matching vision-language-action policies with a learned critic. Directly ap…