1 paper · 1 filter
Hazim Alzorgan, Abolfazl Razi
Actor-critic methods, like Twin Delayed Deep Deterministic Policy Gradient (TD3), depend on basic noise-based exploration, which can result in less than optimal policy convergence.…