1 paper
Zixuan Yang, Yiqun Chen, Wei Yang +7
Reinforcement learning in open-ended long-form generation is challenging because reliable reference answers and automatic metrics are often unavailable. Existing rubric-based metho…