2 papers
cs.CL2026
BabelSteering: Multilingual Safety Alignment via English Steering Vectors
Emma V. Stein, Dominik Meier, Terry Ruas +2
Large language models (LLMs) are deployed globally in high-stakes settings, yet most safety research and alignment efforts remain concentrated on English. Thus, users interacting w…
cs.AI2026
Risky Business: Measuring The Faithfulness-Safety Tension
Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser +3
Chain-of-Thought (CoT) reasoning offers a promising window into model monitoring. However, monitoring relies on faithfulness, i.e., the model output strictly derives from its reaso…