1 paper · 1 filter
Yeonjea Kim, Bumjin Park, Jaesik Choi
Large language models (LLMs) are increasingly released as open-weight models with safeguards against harmful requests. Nevertheless, sentence completion remains vulnerable to incom…