collaborators

5 papers

cs.LG2026

RN-D: Discretized Categorical Actors for On-Policy Reinforcement Learning

Yuexin Bian, Jie Feng, Tao Wang +3

On-policy Reinforcement Learning (RL) remains a dominant paradigm for continuous control, yet standard implementations rely on Gaussian actors and relatively shallow MLP policies,…

quant-ph2026

Hybrid Gaussian-exponential zero-noise extrapolation for periodic circuits

Tao Wang, Yun Shang

Zero-noise extrapolation provides a practical means of suppressing gate errors in current noisy intermediate-scale quantum hardware. The accuracy of the zero-noise estimate depends…

math.NA2026

Two-scale Neural Networks for Singularly Perturbed Dynamical Systems with Multiple Parameters

Qiao Zhuang, Taorui Wang, Rita Wanjiku +2

We extend our two-scale neural-network method for scalar singularly perturbed problems with one small parameter to dynamical systems with multiple small parameters. To accommodate…

math.NA2026

State-dependent temperature control in Langevin diffusions using numerical exploratory Hamiltonian-Jacobi-Bellman equations

Taorui Wang, Xun Li, Gu Wang +1

Choosing how much noise to add in Langevin dynamics is essential for making these algorithms effective in challenging optimization problems. One promising approach is to determine…

cs.LG2025

Improving Value Estimation Critically Enhances Vanilla Policy Gradient

Tao Wang, Ruipeng Zhang, Sicun Gao

Modern policy gradient algorithms, such as TRPO and PPO, outperform vanilla policy gradient in many RL tasks. Questioning the common belief that enforcing approximate trust regions…