1 citations · 1 across the 6 of their papers we have counts for
1 paper · 1 filter
Minseok Choi, Seungbin Yang, Dongjin Kim +5
Despite advances in safety alignment, large language models remain vulnerable to continuously evolving jailbreaks. Existing fine-tuned safety classifiers cannot adapt to these evol…