1 paper · 1 filter
Jiuheng Lin, Cong Jiang, Zirui Wu +2
Training expert LLMs in domains with scarce data is difficult, often relying on multiple-choice questions (MCQs). However, standard outcome-based reinforcement learning (RL) on MCQ…