1 paper · 1 filter
Marco Antonio Stranisci, A Pranav, Rossana Damiano +2
Modern language models rely on pretraining filters to remove undesirable content from training corpora and inference-time guardrails to suppress undesirable outputs during deployme…