1 paper
Deeraj S K, Sadhana Devarajan, Krishna Mehra +1
Reinforcement learning from verifiable emotion rewards RLVER has produced language models with strong empathetic performance, evaluated on benchmarks that assume cooperative, hones…