3 papers
cs.AI2026
RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
Yugu Li, Jimmy Cao, Jianglin Qiao +1
Training multi-turn agentic workflows with reinforcement learning (RL) enables large language models to perform complex reasoning, use external tools, and conduct iterative search…
cs.AI2025
Toward Adaptable Multi-Agent Reinforcement Learning: An Assumption-Aware Review
Siyi Hu, Mohamad A Hady, Jianglin Qiao +3
Multi-Agent Reinforcement Learning (MARL) has achieved strong performance in simulated benchmarks, yet real deployments often violate the assumptions under which algorithms are des…
cs.MA2025
Nucleolus Credit Assignment for Effective Coalitions in Multi-agent Reinforcement Learning
Yugu Li, Zehong Cao, Jianglin Qiao +1
In cooperative multi-agent reinforcement learning (MARL), agents typically form a single grand coalition based on credit assignment to tackle a composite task, often resulting in s…