1 paper
Teng Wang, Zhangyi Jiang, Zhenqi He +9
Recent studies show that Large Language Models (LLMs) achieve strong reasoning capabilities through supervised fine-tuning or reinforcement learning. However, a key approach, the P…