1 paper · 1 filter
Shaobo Wang, Yujie Chen, Yafeng Sun +9
Modern reasoning agents are increasingly evaluated on their ability to generate multiple valid solution paths, plans, or tool-use traces for a given input. Standard reward-maximizi…