1 paper · 1 filter
Zhao Wang, Ziliang Zhao, Zhicheng Dou
Reinforcement learning (RL) has become a promising paradigm for optimizing Retrieval-Augmented Generation (RAG) in complex reasoning tasks. However, traditional outcome-based RL ap…