3 papers
cs.LG2026
Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives
Reza Asad, Reza Babanezhad, Sharan Vaswani
While Soft Actor-Critic (SAC) is highly effective in continuous control, its discrete counterpart (DSAC) performs poorly on challenging discrete-action domains such as Atari. Conse…
cs.LG2026
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
Max Qiushi Lin, Reza Asad, Kevin Tan +3
Although actor-critic methods have been successful in practice, their theoretical analyses have several limitations. Specifically, existing theoretical work either sidesteps the ex…
cs.LG2025
Fast Convergence of Softmax Policy Mirror Ascent
Reza Asad, Reza Babanezhad, Issam Laradji +2
Natural policy gradient (NPG) is a common policy optimization algorithm and can be viewed as mirror ascent in the space of probabilities. Recently, Vaswani et al. [2021] introduced…