1 paper
Zhilin Huang, Hang Gao, Ziqiang Dong +6
Self-distillation improves reasoning in large language models by using the model's own rollouts as training signal, typically through implicit logit-level alignment that minimizes…