1 paper · 1 filter
Tadhg Looram, Lucas Nuzzi, Kyle Waters +1
Much of the focus in RL today is on evaluation design: building meaningful evals that serve simultaneously as benchmarks and as well-defined reward signals for post-training. Yet,…