1 paper · 1 filter
Jiaming Hu, Haoyu Wang, Debarghya Mukherjee +1
Jailbreak attacks pose a serious challenge to the safe deployment of large language models (LLMs). We introduce CCFC (Core & Core-Full-Core), a dual-track, prompt-level defense fra…