1 paper
Jinhan Li, Kexian Tang, Yihan Xu +2
To achieve deeper safety alignment for large language models (LLMs), recent efforts have studied how to push safety interventions earlier into the pretraining stage, primarily by f…