1 paper
Xiaoguang Wu, Zhi Zheng, Hui Xiong
Effective training-time guidance is central to multi-agent reinforcement learning (MARL), yet remains difficult in sparse-reward settings where weak supervision limits coordination…