Showing cs.CRShow all
2 papers · 1 filter
cs.CR2025
MBTSAD: Mitigating Backdoors in Language Models Based on Token Splitting and Attention Distillation
Yidong Ding, Jiafei Niu, Ping Yi
In recent years, attention-based models have excelled across various domains but remain vulnerable to backdoor attacks, often from downloading or fine-tuning on poisoned datasets.…
cs.CR2024
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
Pengzhou Cheng, Yidong Ding, Tianjie Ju +5
Large language models (LLMs) have raised concerns about potential security threats despite performing significantly in Natural Language Processing (NLP). Backdoor attacks initially…