2 papers
cs.CR2025
Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMs
Man Hu, Xinyi Wu, Zuofeng Suo +5
With the rise of advanced reasoning capabilities, large language models (LLMs) are receiving increasing attention. However, although reasoning improves LLMs' performance on downstr…
cs.CR2025
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
Man Hu, Yahui Ding, Yatao Yang +3
As backdoor attacks become more stealthy and robust, they reveal critical weaknesses in current defense strategies: detection methods often rely on coarse-grained feature statistic…