1 paper · 1 filter
Haonan Wang, Weida Liang, Zihang Fu +8
Recent reasoning LLMs (RLMs), especially those trained with verifier-based reinforcement learning, often perform worse with few-shot CoT than with direct answering. We revisit this…