1 paper
Mei Okonkwo, Pixel Nomand, Julian Berg +5
Group relative policy optimization (GRPO) learns only from prompts whose sampled responses disagree: a group that is entirely correct or entirely incorrect has zero reward variance…