1 paper · 1 filter
Boyang Xia, Weiyou Tian, Qingnan Ren +7
Training large language model (LLM) agents for adversarial games is often driven by episodic objectives such as win rate. In long-horizon settings, however, payoffs are shaped by l…