1 paper · 1 filter
Dmytro Filatov, Valentyn Fedorov, Vira Filatova
We study whether Group Relative Policy Optimization (GRPO) can fine-tune small language models for simulated quadrotor continuous-control tasks. In our benchmark, vanilla GRPO fine…