Showing cs.LGShow all
2 papers · 1 filter
cs.LG2025
Interpretable Reward Model via Sparse Autoencoder
Shuyi Zhang, Wei Shi, Sihang Li +3
Large language models (LLMs) have been widely deployed across numerous fields. Reinforcement Learning from Human Feedback (RLHF) leverages reward models (RMs) as proxies for human…
cs.LG2025
Route Sparse Autoencoder to Interpret Large Language Models
Wei Shi, Sihang Li, Tao Liang +4
Mechanistic interpretability of large language models (LLMs) aims to uncover the internal processes of information propagation and reasoning. Sparse autoencoders (SAEs) have demons…