2 papers
cs.CL2026
EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget
Liang Chen, Xueting Han, Qizhou Wang +4
Balancing exploration and exploitation remains a central challenge in reinforcement learning with verifiable rewards (RLVR) for large language models (LLMs). Current RLVR methods o…
cs.CL2026
GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models
Sebastian Gerstner, Hinrich Schütze
We present GLUScope, an open-source tool for analyzing neurons in Transformer-based language models, intended for interpretability researchers. We focus on more recent models than…