1 paper · 1 filter
Gabriele La Malfa, Emanuele La Malfa, Saar Cohen +4
Self-play red team is an established approach to improving AI safety in which different instances of the same model play attacker and defender roles in a zero-sum game, i.e., where…