2 papers
cs.LG2025
Multi-Task Reward Learning from Human Ratings
Mingkang Wu, Devin White, Evelyn Rose +3
Reinforcement learning from human feedback (RLHF) has become a key factor in aligning model behavior with users' goals. However, while humans integrate multiple strategies when mak…
cs.LG2025
Performance Optimization of Ratings-Based Reinforcement Learning
Evelyn Rose, Devin White, Mingkang Wu +3
This paper explores multiple optimization methods to improve the performance of rating-based reinforcement learning (RbRL). RbRL, a method based on the idea of human ratings, has b…