1 paper · 1 filter
Han Zheng, Yining Ma, Karthick Gunasekaran +4
In LLM Reinforcement Fine-Tuning (RFT), curriculum learning drives both efficiency and performance. Yet, current methods externalize curriculum judgment via handcrafted heuristics…