Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics
Sofiia Nikolenko, Michele Papucci, Mina Rezaei +1
Jailbreak attacks reveal a persistent weakness in aligned Large Language Models: carefully crafted prompts can elicit policy-violating responses despite safety training. While most…
cs.CL2025
Mitigating Catastrophic Forgetting in Continual Learning through Model Growth
Ege Süalp, Mina Rezaei
Catastrophic forgetting is a significant challenge in continual learning, in which a model loses prior knowledge when it is fine-tuned on new tasks. This problem is particularly cr…