1 paper
Yue Zhou, Henry Peng Zou, Barbara Di Eugenio +1
We find that language models have difficulties generating fallacious and deceptive reasoning. When asked to generate deceptive outputs, language models tend to leak honest counterp…