1 paper
Qi Sun, Siyue Zhang, Yulin Chen +3
Training strong large language models (LLMs) requires high-quality supervision, which is often scarce. Recent work shows that paired preference data from weak-weaker model pairs (e…