1 paper · 1 filter
Deeraj S K, Sadhana Devarajan, Krishna Mehra +1
Reinforcement learning from verifiable emotion rewards RLVER has produced language models with strong empathetic performance, evaluated on benchmarks that assume cooperative, hones…