1 paper
Haijiang Li, Chengyu Lv, Yi Zhang +8
Verifiable outcome rewards guide language-model post-training, but sequence-level advantages do not identify which token-level decisions should be preserved or revised. Evidence-co…