1 paper
Ziqian Wang, Jiayu Sun, Yitian Liu +3
We propose Q-Guided Value-Gradient Matching (Q-VGM), an offline-to-online reinforcement learning (RL) method for fine-tuning flow-matching vision-language-action (VLA) policies wit…