2 papers
cs.CL2026
MemEvoBench: Benchmarking Safety Risks from Memory Misevolution in LLM Agents
Weiwei Xie, Shaoxiong Guo, Fan Zhang +5
Equipping Large Language Models (LLMs) with persistent memory enhances interaction continuity and personalization but introduces new safety risks. Specifically, contaminated or bia…
cs.CL2025
Preventing Catastrophic Forgetting: Behavior-Aware Sampling for Safer Language Model Fine-Tuning
Anh Pham, Mihir Thalanki, Michael Sun +6
Large language models often lose previously aligned safety behaviors when fine-tuned on benign data, a phenomenon known as catastrophic forgetting. Prior work shows that adding ran…