3 papers
cs.CR2026
NeuroArmor: Safe-Variant-Guided Representation Consistency for Selective Re-Anchoring in Jailbreak Defense
Zhongyang Lin, Ziran Zhao, Feifei Zhai +1
Large language models remain vulnerable to jailbreak attacks that hide harmful intent behind seemingly ordinary requests such as role-play, translation, encoding, adversarial suffi…
cs.CR2026
DualSentinel: A Lightweight Framework for Detecting Targeted Attacks in Black-box LLM via Dual Entropy Lull Pattern
Xiaoyi Pang, Xuanyi Hao, Pengyu Liu +3
Recent intelligent systems integrate powerful Large Language Models (LLMs) through APIs, but their trustworthiness may be critically undermined by targeted attacks like backdoor an…
cs.CL2025
How Privacy-Savvy Are Large Language Models? A Case Study on Compliance and Privacy Technical Review
Yang Liu, Xichou Zhu, Zhou Shen +13
The recent advances in large language models (LLMs) have significantly expanded their applications across various fields such as language generation, summarization, and complex que…