3 papers
cs.CL2026
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
Wenjie Tang, Minne Li, Sijie Huang +2
Reinforcement learning from verifiable rewards (RLVR) is a promising paradigm for improving large language model (LLM) agents on long-horizon interactive tasks. However, in partial…
cs.AI2026
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
Wenjie Tang, Yuan Zhou, Erqiang Xu +3
Large language model (LLM)-based agents are increasingly applied to complex strategic environments that demand long-horizon reasoning, multi-agent interaction, and decision-making…
cs.LG2025
PMAT: Optimizing Action Generation Order in Multi-Agent Reinforcement Learning
Kun Hu, Muning Wen, Xihuai Wang +5
Multi-agent reinforcement learning (MARL) faces challenges in coordinating agents due to complex interdependencies within multi-agent systems. Most MARL algorithms use the simultan…