1 paper · 1 filter
Ekaterina Krupkina, Dmitrii Volkov
We show a version of Qi et al. 2023's simple fine-tuning poisoning technique strips GPT-4o's safety guardrails without degrading the model. The BadGPT attack matches best white-box…