1 paper
Chengzhi Hu, Jonas Dornbusch, David Lüdke +2
Adversarial training for LLMs is one of the most promising methods to reliably improve robustness against adversaries. However, despite significant progress, models remain vulnerab…