1 paper
Aditya Kapoor, Sushant Swamy, Kale-ab Tessera +4
In multi-agent environments, agents often struggle to learn optimal policies due to sparse or delayed global rewards, particularly in long-horizon tasks where it is challenging to…