1 paper · 1 filter
Sai Kartheek Reddy Kasu, Nils Lukas, Samuele Poppi
Failures in multi-turn reasoning models are largely invisible to terminal-score evaluation. A model can lock onto an unsafe stance early in a long dialogue, yet its final-turn refu…