1 paper · 1 filter
Xinyu Liu, Darryl Cherian Jacob, Yang Zhou +2
Recent reinforcement learning (RL) post-training approaches primarily optimize the final output policy using sparse outcome-level rewards, while largely overlooking predictive sign…