1 paper · 1 filter
Yanbo Wang, Jinhua Hao, Yuze Shi +2
LLM agents often degrade over long episodes: as trajectories grow, they revisit explored states, repeat failed actions, and lose strategies that previously worked. Test-time traini…