4 citations · 4 across the 1 of their papers we have counts for
1 paper
Nathaniel Li, Ziwen Han, Ian Steneker +6
Recent large language model (LLM) defenses have greatly improved models' ability to refuse harmful queries, even when adversarially attacked. However, LLM defenses are primarily ev…