Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training
Ting Zhou, Zhenqing Ling, Daoyuan Chen +4
Reinforcement learning (RL) has become a central post-training paradigm for eliciting reasoning capabilities in large language models, yet uniform task sampling allocates compute w…
cs.LG2026
GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning
Ting Zhou, Zhenqing Ling, Yiyang Zhao +2
Online reinforcement learning is widely used to align large language models (LLMs) with reward signals, yet training can be unstable under noisy or misspecified rewards. We identif…