1 paper
Zhengxi Lu, Yuxiang Chai, Yaxuan Guo +7
The recent DeepSeek-R1 has showcased the emergence of reasoning capabilities in LLMs through reinforcement learning (RL) with rule-based rewards. Despite its success in language mo…