1 paper · 1 filter
Rebecca Ramnauth, Brian Scassellati
Instruction-based suppression is widely used to prevent language models from generating prohibited content, yet it remains unclear whether suppression reduces internal representati…