1 paper
Marcello Galisai, Susanna Cifani, Francesco Giarrusso +5
The Adversarial Humanities Benchmark (AHB) evaluates whether model safety refusals survive a shift away from familiar harmful prompt forms. Starting from harmful tasks drawn from M…