1 paper · 1 filter
Chengzhi Hu, Jonas Dornbusch, David Lüdke +2
Adversarial training for LLMs is one of the most promising methods to reliably improve robustness against adversaries. However, despite significant progress, models remain vulnerab…