1 paper · 1 filter
Hongfu Liu, Yuxi Xie, Ye Wang +1
Language Language Models (LLMs) face safety concerns due to potential misuse by malicious users. Recent red-teaming efforts have identified adversarial suffixes capable of jailbrea…