1 paper · 1 filter
Daniel Barzilai, Yotam Wolf, Ronen Basri
The emergence of compositional reasoning in large language models through reinforcement learning with verifiable rewards (RLVR) has been a key driver of recent empirical successes.…