1 paper · 1 filter
Micah Rentschler, Jesse Roberts
Most reinforcement learning (RL) methods for training large language models (LLMs) require ground-truth labels or task-specific verifiers, limiting scalability when correctness is…