Showing cs.CRShow all
2 papers · 1 filter
cs.CR2026★ 1 cited
Watermarking Language Models with Error Correcting Codes
Patrick Chao, Yan Sun, Edgar Dobriban +1
Recent progress in large language models enables the creation of realistic machine-generated content. Watermarking is a promising approach to distinguish machine-generated text fro…
cs.CR2024
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
Patrick Chao, Edoardo Debenedetti, Alexander Robey +9
Jailbreak attacks cause large language models (LLMs) to generate harmful, unethical, or otherwise objectionable content. Evaluating these attacks presents a number of challenges, w…