2 papers
cs.AI2025
Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
Niklas Lauffer, Ameesh Shah, Micah Carroll +3
Adversarial optimization algorithms that explicitly search for flaws in agents' policies have been successfully applied to finding robust and diverse policies in multi-agent settin…
cs.LG2025
BAMDP Shaping: a Unified Framework for Intrinsic Motivation and Reward Shaping
Aly Lidayan, Michael Dennis, Stuart Russell
Intrinsic motivation and reward shaping guide reinforcement learning (RL) agents by adding pseudo-rewards, which can lead to useful emergent behaviors. However, they can also encou…