1 paper · 1 filter
Shuvendu Roy, Hossein Hajimirsadeghi, Mengyao Zhai +1
Recent advances in large language models have demonstrated the promise of unsupervised reinforcement learning (RL) methods for enhancing reasoning capabilities without external sup…