1 paper
Bizhe Bai, Hongming Wu, Peng Ye +1
Self-supervised reinforcement learning (RL) presents a promising approach for enhancing the reasoning capabilities of Large Language Models (LLMs) without reliance on expensive hum…