1 paper
Zhangying Feng, Qianglong Chen, Ning Lu +6
The development of reasoning capabilities represents a critical frontier in large language models (LLMs) research, where reinforcement learning (RL) and process reward models (PRMs…