6 papers
ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning
Daiki E. Matsunaga, Junho Na, Tri Wahyu Guntara +4
Cooperative tasks in Multi-Agent Reinforcement Learning (MARL) require agents to collectively maximize a shared return. Under the Centralized Training with Decentralized Execution…
Blocked Gibbs meets Diffusion Transformers: Unsupervised Learning for Constraint Optimization
Yudong W. Xu, Wenhao Li, Xiaoyu Wang +2
Diffusion models have shown promise in learning to solve constraint optimization problems. However, they are mostly restricted to problems with binary variables and rely on graph n…
Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens
Jihwan Jeong, Xiaoyu Wang, Jingmin Wang +2
Offline reinforcement learning (RL) is crucial when online exploration is costly or unsafe but often struggles with high epistemic uncertainty due to limited data. Existing methods…
Constraint-Generation Policy Optimization (CGPO): Nonlinear Programming for Policy Optimization in Mixed Discrete-Continuous MDPs
Michael Gimelfarb, Ayal Taitler, Scott Sanner
We propose the Constraint-Generation Policy Optimization (CGPO) framework to optimize policy parameters within compact and interpretable policy classes for mixed discrete-continuou…
Generalized Multi-hop Traffic Pressure for Heterogeneous Traffic Perimeter Control
Xiaocan Li, Xiaoyu Wang, Ilia Smirnov +2
Perimeter control (PC) prevents loss of traffic network capacity due to congestion in urban areas. Homogeneous PC allows all access points to a protected region to have identical p…
Multi-hop Upstream Anticipatory Traffic Signal Control with Deep Reinforcement Learning
Xiaocan Li, Xiaoyu Wang, Ilia Smirnov +2
Coordination in traffic signal control is crucial for managing congestion in urban networks. Existing pressure-based control methods focus only on immediate upstream links, leading…