1 paper
Fei Ding, Yongkang Zhang, Youwei Wang +1
Reinforcement learning for multi-step reasoning with large language models (LLMs) typically relies on sparse terminal rewards, which creates a poorly conditioned credit-assignment…