1 paper · 1 filter
Anton Xue, Avishree Khare, Rajeev Alur +2
We study how to subvert large language models (LLMs) from following prompt-specified rules. We first formalize rule-following as inference in propositional Horn logic, a mathematic…