From the 1 of 8 linked papers with an AI index.
1 paper · 1 filter
Zeming Wei, Zhixin Zhang, Chengcan Wu +3
Large Language Models (LLMs) face severe safety risks from jailbreak attacks, yet current safety testing largely relies on static datasets and lacks systematic criteria to evaluate…