2 papers
cs.LG2026
Mirror Descent Actor Critic via Bounded Advantage Learning
Ryo Iwaki
Regularization is a core component of recent Reinforcement Learning (RL) algorithms. Mirror Descent Value Iteration (MDVI) uses both Kullback-Leibler divergence and entropy as regu…
cs.LG2026
Distorted Distributional Policy Evaluation for Offline Reinforcement Learning
Ryo Iwaki, Takayuki Osogami
While Distributional Reinforcement Learning (DRL) methods have demonstrated strong performance in online settings, its success in offline scenarios remains limited. We hypothesize…