1 paper
Teng Pan, Yuchen Yan, Zixuan Wang +6
Label-free reinforcement learning enables large language models to improve reasoning capabilities without ground-truth supervision, typically by treating majority-voted answers as…