2 papers
cs.CL2026
Investigating Assistant Bias in LLM User Simulators Using a Role Vector
Daeheon Jeong, Yoonjoo Lee, Eugene Choi +2
LLM-based user simulators are increasingly used to evaluate autonomous agents at scale, in place of costly human evaluations. Despite this promise, these simulators exhibit "assist…
cs.LG2026
Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance
Sinie van der Ben, Neele Roch, Anna Hedström +1
Cross-paper comparison of sparse autoencoder (SAE) interpretability often relies on autointerpretability scores. In this evaluation pipeline, a language model (LM) explains each fe…