1 paper · 1 filter
Yifei Li, Lingling Zhang, Muye Huang +3
Post-training large language models usually applies a single training recipe to all samples, even though the model's own rollouts reveal different sample-level learning states. We…