1 paper
Lingyu Li, Yan Teng, Yingchun Wang +1
Aligning large language models (LLMs) is essential for their safe deployment. Current alignment methods mainly optimize observable responses, yet models remain vulnerable when the…