3 papers
cs.CR2026
BadLLM-TG: A Backdoor Defender powered by LLM Trigger Generator
Ruyi Zhang, Heng Gao, Songlei Jian +2
Backdoor attacks compromise model reliability by using triggers to manipulate outputs. Trigger inversion can accurately locate these triggers via a generator and is therefore criti…
cs.AI2026
Cognitive Chunking for Soft Prompts: Accelerating Compressor Learning via Block-wise Causal Masking
Guojie Liu, Yiqi Wang, Yanfeng Yang +4
Providing extensive context via prompting is vital for leveraging the capabilities of Large Language Models (LLMs). However, lengthy contexts significantly increase inference laten…
cs.CR2026
JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
Xi Wang, Songlei Jian, Shasha Li +5
Despite extensive safety alignment, Large Language Models (LLMs) often fail against jailbreak attacks. While machine unlearning has emerged as a promising defense by erasing specif…