2 papers
cs.AI2026
HetGPS: Scalable Graph Multi-Agent Reinforcement Learning with Physics-Anchored Adaptive Safety for EV Charging
Xiangwei Wang, Nanduni Nimalsiri, Yu Xia +2
Safety interventions for large populations of network-coupled agents must protect shared constraints without unnecessarily overriding task-oriented policy decisions. We present Het…
cs.AI2026
Discovering Process-Outcome Credit in Multi-Step LLM Reasoning
Xiangwei Wang, Wei Wang, Ken Chen +2
Reinforcement Learning (RL) serves as a potent paradigm for enhancing reasoning capabilities in Large Language Models (LLMs), yet standard outcome-based approaches often suffer fro…