2 papers
cs.LG2025
LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data
Changsheng Wang, Yihua Zhang, Dennis Wei +3
Large language models (LLMs) exhibit remarkable generative capabilities but raise ethical and security concerns by memorizing sensitive data, reinforcing biases, and producing harm…
cs.AI2025
Bridging Models to Defend: A Population-Based Strategy for Robust Adversarial Defense
Ren Wang, Yuxuan Li, Can Chen +6
Adversarial robustness is a critical measure of a neural network's ability to withstand adversarial attacks at inference time. While robust training techniques have improved defens…