1 paper
Yuqi Ye, Shangkun Sun, Junhong Lin +6
Recent VLM-based autonomous driving planners adopt GRPO-style reinforcement learning to optimize driving performance. However, existing GRPO recipes either optimize driving efficie…