1 paper
Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao +1
Does reinforcement learning genuinely expand what LLM agents can do, or merely make them more reliable? For static reasoning, recent work answers the second: base and RL pass@k cur…