1 paper
Liyu Zhang, Kehan Li, Tingrui Han +4
Post training via GRPO has demonstrated remarkable effectiveness in improving the generation quality of flow-matching models. However, GRPO suffers from inherently low sample effic…