1 paper
Taoran Liang, Yang Liu, Shang Luo +9
Reinforcement learning is now the standard way to train large language model agents on long-horizon tasks, where dozens of interdependent actions precede a single sparse reward. Cr…