1 paper · 1 filter
Yukai Zhou, Jian Lou, Zhijie Huang +3
Ensuring the safety alignment of Large Language Models (LLMs) is critical for generating responses consistent with human values. However, LLMs remain vulnerable to jailbreaking att…