Showing cs.LGShow all
2 papers · 1 filter
cs.LG2025
Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior
Daniel Aarao Reis Arturi, Eric Zhang, Andrew Ansah +3
Recent work has discovered that large language models can develop broadly misaligned behaviors after being fine-tuned on narrowly harmful datasets, a phenomenon known as emergent m…
cs.LG2024
Unforgettable Generalization in Language Models
Eric Zhang, Leshem Choshen, Leshem Chosen +1
When language models (LMs) are trained to forget (or "unlearn'') a skill, how precisely does their behavior change? We study the behavior of transformer LMs in which tasks have bee…