2 papers
cs.AI2026
Multi-Agent Guided Policy Optimization
Yueheng Li, Guangming Xie, Zongqing Lu
Due to practical constraints such as partial observability and limited communication, Centralized Training with Decentralized Execution (CTDE) has become the dominant paradigm in c…
cs.LG2026
Guided Policy Optimization under Partial Observability
Yueheng Li, Guangming Xie, Zongqing Lu
Reinforcement Learning (RL) in partially observable environments poses significant challenges due to the complexity of learning under uncertainty. While additional information, suc…