2 papers
cs.LG2025
StaQ: a Finite Memory Approach to Discrete Action Policy Mirror Descent
Alena Shilova, Alex Davey, Brahim Driss +1
In Reinforcement Learning (RL), regularization with a Kullback-Leibler divergence that penalizes large deviations between successive policies has emerged as a popular tool both in…
cs.AI2025
PB: Preference Space Exploration via Population-Based Methods in Preference-Based Reinforcement Learning
Brahim Driss, Alex Davey, Riad Akrour
Preference-based reinforcement learning (PbRL) has emerged as a promising approach for learning behaviors from human feedback without predefined reward functions. However, current…