Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Tracking the Moving Frontier: Long-Short Term Advantage Estimator
Xinhao Yao, Lu Yu, Changhao Wang +5
Group-based RLVR methods estimate advantages by repeatedly sampling multiple trajectories for each prompt, making long-horizon agent training expensive and discarding useful experi…
cs.LG2026
UniGeM: Unifying Data Mixing and Selection via Geometric Exploration and Mining
Changhao Wang, Yunfei Yu, Xinhao Yao +5
The scaling of Large Language Models (LLMs) is increasingly limited by data quality. Most methods handle data mixing and sample selection separately, which can break the structure…