1 paper
Zihan Liang, Yufei Ma, Ben Chen +6
Reinforcement learning has emerged as an effective paradigm for training large language models to perform search-augmented reasoning. However, existing approaches rely on trajector…