1 paper · 1 filter
Agnieszka Mensfelt, Adarsh Prabhakaran, Adrian Haret +2
Frontier reasoning-tuned language models still fail on deductive tasks at depth, and the cost of improved performance through extended internal reasoning scales poorly. Symbolic de…