2 papers
cs.CL2026
Expert-Aware Refusal Steering
Anna C. Marbut, Daniel R. Olson, Travis J. Wheeler
Safety alignment in instruction-tuned large language models (LLMs) depends on a model's ability to reliably refuse to respond to harmful or disallowed requests. Recent work has sho…
cs.CL2024
Exploring the Impact of a Transformer's Latent Space Geometry on Downstream Task Performance
Anna C. Marbut, John W. Chandler, Travis J. Wheeler
It is generally thought that transformer-based large language models benefit from pre-training by learning generic linguistic knowledge that can be focused on a specific task durin…