1 paper
Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang +1
Self-play can train language models without external supervision. However, existing methods require rule-checkable answers, leaving open-ended tasks dependent on curated prompts or…