1 paper · 1 filter
Xuan Gong, Senmiao Wang, Hanbo Huang +2
Supervised fine-tuning (SFT) on long chain-of-thought (CoT) trajectories has emerged as a crucial technique for enhancing the reasoning abilities of large language models (LLMs). H…