collaborators

9 papers

cs.CR2026

Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment

Lipeng He, Yihan Wang, Jiawen Zhang +1

Indirect prompt injection attacks hijack LLM-based agents by embedding malicious instructions in third-party data that the agent retrieves during task execution. Existing defenses…

cs.CR2026

SoK: Colluding Adversaries in Machine Learning Pipelines

Vasisht Duddu, Lipeng He, Asim Waheed +1

Machine learning (ML) models are susceptible to various security, privacy, and fairness risks. Adversaries with different characteristics (i.e., objectives, knowledge, and capabili…

cs.CL2026

Extracting Training Data from Diffusion Language Models via Infilling

Yihan Wang, N. Asokan

Memorization in large language models has been studied almost exclusively through prefix-conditioned extraction, a natural choice for autoregressive models. However, diffusion lang…

cs.CR2026

Locket: Robust Feature-Locking Technique for Language Models

Lipeng He, Vasisht Duddu, N. Asokan

Chatbot service providers (e.g., OpenAI) rely on tiered subscription plans to generate revenue, offering black-box access to basic models for free users and advanced models to payi…

cs.CR2026

PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing

Anthony Hughes, Vasisht Duddu, N. Asokan +2

Language models (LMs) may memorize personally identifiable information (PII) from training data, enabling adversaries to extract it during inference. Existing defense mechanisms su…

cs.CR2025

Amulet: a Python Library for Assessing Interactions Among ML Defenses and Risks

Asim Waheed, Vasisht Duddu, Rui Zhang +1

Machine learning (ML) models are susceptible to various risks to security, privacy, and fairness. Most defenses are designed to protect against each risk individually (intended int…