1 paper · 1 filter
Brian R. Y. Huang, Maximilian Li, Leonard Tang
Despite extensive safety measures, LLMs are vulnerable to adversarial inputs, or jailbreaks, which can elicit unsafe behaviors. In this work, we introduce bijection learning, a pow…