1 paper
Skylar Zhai, Jingcheng Liang, Dongyeop Kang
Reinforcement fine-tuning improves the reasoning ability of large language models, but it can also encourage them to answer unanswerable queries by guessing or hallucinating missin…