1 paper · 1 filter
Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim +1
Safety alignment is essential for deploying large language models, requiring systems to prevent harmful compliance while preserving helpfulness on benign requests. Activation steer…