1 paper
Navan Preet Singh, Xiaokun Wang, Anurag Garikipati +3
We present an innovative multi-stage optimization strategy combining reinforcement learning (RL) and supervised fine-tuning (SFT) to enhance the pedagogical knowledge of large lang…