10 citations · 10 across the 6 of their papers we have counts for
Showing 2026Show all
3 papers · 1 filter
math.OC2026
Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning
Jialun Cao, Fernando Acero, David Šiška +1
Entropy regularization is widely used in continuous-time reinforcement learning (RL) to reduce sensitivity to environmental perturbations, yet its robustness benefits lack a rigoro…
cs.LG2026
Global linear convergence of entropy-regularized softmax policy gradient beyond tabular MDPs
Ziyue Chen, David Šiška, Lukasz Szpruch
We study the global convergence of policy gradient for infinite-horizon entropy-regularized Markov decision processes (MDPs) with continuous state and action spaces. We consider lo…
cs.LG2026
A note on convergence of Wasserstein policy optimization
David Šiška, Yufei Zhang
Wasserstein Policy Optimization (WPO) is a recently proposed reinforcement learning algorithm that leverages Wasserstein gradient flows to optimize stochastic policies in continuou…