1 paper
Shicheng Fan, Haochang Hao, Dehai Min +3
Applying reinforcement learning to improve factual accuracy in knowledge-intensive question answering faces a reward design dilemma. Response-level rewards provide only coarse supe…