1 paper · 1 filter
Weiliang Zhao, Jinjun Peng, Daniel Ben-Levi +2
The proliferation of powerful large language models (LLMs) has necessitated robust safety alignment, yet these models remain vulnerable to evolving adversarial attacks, including m…