collaborators

6 papers

cs.AI2026

ACPO: Agent-Chained Policy Optimization for Multi-Agent Reinforcement Learning

Daiki E. Matsunaga, Junho Na, Tri Wahyu Guntara +4

Cooperative tasks in Multi-Agent Reinforcement Learning (MARL) require agents to collectively maximize a shared return. Under the Centralized Training with Decentralized Execution…

cs.LG2026

Blocked Gibbs meets Diffusion Transformers: Unsupervised Learning for Constraint Optimization

Yudong W. Xu, Wenhao Li, Xiaoyu Wang +2

Diffusion models have shown promise in learning to solve constraint optimization problems. However, they are mostly restricted to problems with binary variables and rely on graph n…

cs.AI2025

Reflect-then-Plan: Offline Model-Based Planning through a Doubly Bayesian Lens

Jihwan Jeong, Xiaoyu Wang, Jingmin Wang +2

Offline reinforcement learning (RL) is crucial when online exploration is costly or unsafe but often struggles with high epistemic uncertainty due to limited data. Existing methods…

math.OC2025

Constraint-Generation Policy Optimization (CGPO): Nonlinear Programming for Policy Optimization in Mixed Discrete-Continuous MDPs

Michael Gimelfarb, Ayal Taitler, Scott Sanner

We propose the Constraint-Generation Policy Optimization (CGPO) framework to optimize policy parameters within compact and interpretable policy classes for mixed discrete-continuou…

cs.LG2025

Generalized Multi-hop Traffic Pressure for Heterogeneous Traffic Perimeter Control

Xiaocan Li, Xiaoyu Wang, Ilia Smirnov +2

Perimeter control (PC) prevents loss of traffic network capacity due to congestion in urban areas. Homogeneous PC allows all access points to a protected region to have identical p…

cs.LG2025

Multi-hop Upstream Anticipatory Traffic Signal Control with Deep Reinforcement Learning

Xiaocan Li, Xiaoyu Wang, Ilia Smirnov +2

Coordination in traffic signal control is crucial for managing congestion in urban networks. Existing pressure-based control methods focus only on immediate upstream links, leading…