Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling
Kai Zhang, Jiayi Liao, Chengpeng Li +3
Test-Time Scaling (TTS) has emerged as an effective paradigm for improving the reasoning performance of large language models (LLMs). However, existing methods -- most notably majo…
cs.CL2026
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
Wei Shi, Ziyuan Xie, Sihang Li +1
Reinforcement learning from human feedback (RLHF) is a key paradigm for aligning large language models (LLMs) with human values, yet the reward models at its core remain largely op…