1 paper · 1 filter
Sumanta Bhattacharyya, Sara Riazi, Pedram Rooshenas
Training a task-specific small reasoning model is challenging when direct human supervision or high-quality labels are scarce. However, LLMs with reasoning capabilities produce abu…