1 paper · 1 filter
Alex Polyakov, Daniel Kuznetsov
Safety alignment in large language models relies on behavioral training that can be overridden when sufficiently strong in-context patterns compete with learned refusal behaviors.…