1 paper
Yu Han, Kailing Li, Yang Jiao +4
Training large language models (LLMs) as autonomous agents via reinforcement learning (RL) has enabled frontier models to achieve superhuman performance in long-horizon tasks. Howe…