Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization
Kavin Aravindan, Arihant Rastogi, Aadi Prasad +4
Activation steering provides a lightweight mechanism for controlling large language models at inference time, but steering vectors can have unintended externalities: utility vector…
cs.LG2026
Features as Rewards: Scalable Supervision for Open-Ended Tasks via Interpretability
Aaditya Vikram Prasad, Connor Watts, Jack Merullo +4
Language models trained on large-scale datasets have been shown to learn features that encode abstract concepts such as factuality or intent. Such features are traditionally used f…