1 paper · 1 filter
Bodla Krishna Vamshi, Haizhao Yang
Recent years have witnessed the widespread adoption of reinforcement learning (RL), from solving real-time games to fine-tuning large language models using human preference data si…