1 paper · 1 filter
Jehyeok Yeon, Federico Cinus, Yifan Wu +1
Sparse autoencoders (SAEs) are increasingly used to extract activation directions for inference-time steering, but their standard sparsity objective treats latent features as indep…