1 paper · 1 filter
Can Jin, Yang Zhou, Qixin Zhang +8
Test-time scaling strategies for Large Language Models predominantly rely on either reinforcement learning with sparse outcome rewards or search-based methods guided by static Proc…