Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF
Doo Hwan Hwang, Kee-Eung Kim
Reinforcement Learning from Human Feedback (RLHF) for Large Language Models increasingly relies on critic-free methods as a practical alternative to actor--critic training. Despite…
cs.LG2024
Kernel Metric Learning for In-Sample Off-Policy Evaluation of Deterministic RL Policies
Haanvid Lee, Tri Wahyu Guntara, Jongmin Lee +2
We consider off-policy evaluation (OPE) of deterministic target policies for reinforcement learning (RL) in environments with continuous action spaces. While it is common to use im…