1 paper · 1 filter
Justin Cui, Wei-Lin Chiang, Ion Stoica +1
Large Language Models (LLMs) require careful safety alignment to prevent malicious outputs. While significant research focuses on mitigating harmful content generation, the enhance…