1 paper
Guoxin Shi, Haoyu Wang, Zaihui Yang +2
Adversarial behavior plays a central role in aligning large language models with human values. However, existing alignment methods largely rely on static adversarial settings, whic…