1 paper · 1 filter
Daisuke Nohara, Taishi Nakamura, Rio Yokota
Reinforcement learning substantially improves reasoning in large language models, but it also tends to lengthen chain-of-thought outputs and increase computational cost. Although l…