1 paper · 1 filter
Hongling Xu, Qi Zhu, Heyuan Deng +6
Recent advances in large language model (LLM) post-training have leveraged two distinct paradigms to enhance reasoning capabilities: reinforcement learning (RL) and knowledge disti…