1 paper · 1 filter
Siyu Chen, Haoran Wang, Xiaojian Li +3
Multi-turn jailbreak attacks demonstrate that harmful intent can be distributed across dialogue, yet existing methods obscure what conversational mechanisms drive vulnerability. We…