1 paper · 1 filter
Bodong Du, Xuanqi Huang, Xiaomeng Li
Test-time reinforcement learning (TTRL) enables large language models (LLMs) to self-improve on unlabeled inputs, but its effectiveness critically depends on how reward signals are…