collaborators

11 papers

cs.CL2026

Data Attribution of Emergent Misalignment with Persona Features

Clemens Vetter, David Kaczér, Lucie Flek +1

Emergent misalignment (EM) is the phenomenon where fine-tuning a language model on a narrow task leads to harmful behavior in unrelated domains. A leading mechanistic account attri…

cs.LG2026

In-Training Defenses against Emergent Misalignment in Language Models

David Kaczér, Magnus Jørgenvåg, Clemens Vetter +4

Fine-tuning lets practitioners repurpose aligned large language models (LLMs) for new domains, yet recent work reveals emergent misalignment (EM): Even a small, domain-specific fin…

cs.CL2026

Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?

Shivam Rawat, Lucie Flek, Florian Mai +1

Reasoning in large language models is often discussed as a single capability, but some of its gains may stem from simpler underlying operations. We examine two such primitives, rec…

cs.LG2026

Transfer Learning Across Fast- and Full-Simulation Domains in High-Energy Physics

Matthias Schott, Lucie Flek

Machine-learning models in high-energy physics are often trained on simulated data, where fully simulated samples are computationally expensive while fast simulation provides large…

cs.LG2026

Uncovering Hidden Systematics in Neural Network Models for High Energy Physics

Lucie Flek, Philipp Alexander Jungs, Akbar Karimi +6

Neural networks (NNs) are inherently multidimensional classifiers that learn complex, non-linear relationships among input observables. While their flexibility enables unprecedente…

cs.LG2026

Learning Minimal-Deviation Corrections for Multi-Dimensional Mismodelling in HEP Simulations

Matthias Schott, Lucie Flek

Accurate Monte Carlo (MC) modelling in high-energy physics is challenging, particularly in complex scenarios where simulations fail to reproduce observed data. In practice, experim…