1 paper · 1 filter
Xin Guan, Zijian Li, Shen Huang +3
While Reinforcement Learning (RL) has advanced LLM reasoning, applying it to long-context scenarios is hindered by sparsity of outcome rewards. This limitation fails to penalize un…