2 papers
cs.AI2025
Stronger Enforcement of Instruction Hierarchy via Augmented Intermediate Representations
Sanjay Kariyappa, G. Edward Suh
Prompt injection attacks are a critical security vulnerability in large language models (LLMs), allowing attackers to hijack model behavior by injecting malicious instructions with…
cs.CL2024
Sequence-Level Leakage Risk of Training Data in Large Language Models
Trishita Tiwari, G. Edward Suh
This work quantifies the risk of training data leakage from LLMs (Large Language Models) using sequence-level probabilities. Computing extraction probabilities for individual seque…