Showing cs.LGShow all
3 papers · 1 filter
cs.LG2026
Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment
Yanwei Jia, Du Ouyang
This paper studies the policy gradient update for a multi-arm bandit problem in diffusion environment that is described by a stochastic differential equation (SDE) under the contin…
cs.LG2026
A Zeroth-Order Deep Learning Method for Fully Nonlinear Parabolic Partial Differential Equations with Unknown Coefficients
Yanwei Jia, Du Ouyang, Huyên Pham +1
High-dimensional partial differential equations (PDEs) with unknown coefficients arise widely in scientific machine learning, including continuous-time reinforcement learning, yet…
cs.LG2025
Accuracy of Discretely Sampled Stochastic Policies in Continuous-time Reinforcement Learning
Yanwei Jia, Du Ouyang, Yufei Zhang
Stochastic policies (also known as relaxed controls) are widely used in continuous-time reinforcement learning algorithms. However, executing a stochastic policy and evaluating its…