1 paper · 1 filter
Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham +3
Frontier AI systems are increasingly capable and deployed in high-stakes multi-agent environments. However, existing AI safety benchmarks largely evaluate single agents, leaving mu…