2 papers
cs.LG2024
When Your AIs Deceive You: Challenges of Partial Observability in Reinforcement Learning from Human Feedback
Leon Lang, Davis Foote, Stuart Russell +3
Past analyses of reinforcement learning from human feedback (RLHF) assume that the human evaluators fully observe the environment. What happens when human feedback is based only on…
cs.RO2024
Trajectory Improvement and Reward Learning from Comparative Language Feedback
Zhaojing Yang, Miru Jun, Jeremy Tien +3
Learning from human feedback has gained traction in fields like robotics and natural language processing in recent years. While prior works mostly rely on human feedback in the for…