4 papers
Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework
Zhaoqi Wang, Daqing He, Zijian Zhang +13
While retrieval-augmented generation systems partially address the hallucination issues in large language models, it also introduces new vulnerabilities to knowledge corruption att…
Rényi Pufferfish Privacy with Gaussian-based Priors: From Single Gaussian to Mixture Model
Wenjin Yang, Ni Ding, Zijian Zhang +5
Rényi Pufferfish Privacy (RPP) provides a Rényi divergence-based privacy framework for correlated data, but existing -Wasserstein mechanisms are often conservative and sa…
Noise Reduction for Pufferfish Privacy: A Practical Noise Calibration Method
Wenjin Yang, Ni Ding, Zijian Zhang +8
This paper introduces a relaxed noise calibration method to enhance data utility while attaining pufferfish privacy. This work builds on the existing -Wasserstein (Kantorovich)…
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
Zhaoqi Wang, Zijian Zhang, Daqing He +5
Large language models (LLMs) have demonstrated remarkable capabilities across diverse applications, however, they remain critically vulnerable to jailbreak attacks that elicit harm…