1 paper · 1 filter
Yiqi Liu, Yang Wang, Songxin Wang +2
When a language model refuses to answer a prompt, it is unclear whether the correct answer is erased from its internal representations, or merely suppressed at the output layer. We…