1 paper · 1 filter
Advait Yadav, Haibo Jin, Man Luo +2
Large Language Models (LLMs) have demonstrated remarkable capabilities across various domains. However, their potential to generate harmful responses has raised significant societa…