3 papers
cs.LG2026
Ratio-Variance Regularized Policy Optimization
Yu Luo, Shuo Han, Yihan Hu +5
Standard on-policy reinforcement learning relies on heuristic clipping to enforce trust regions, but this mechanism imposes a severe cost by indiscriminately truncating high-return…
cs.LG2026
D2 Actor Critic: Diffusion Actor Meets Distributional Critic
Lunjun Zhang, Shuo Han, Hanrui Lyu +1
We introduce D2AC, a new model-free reinforcement learning (RL) algorithm designed to train expressive diffusion policies online effectively. At its core is a policy improvement ob…
cs.LG2025
Of Mice and Machines: A Comparison of Learning Between Real World Mice and RL Agents
Shuo Han, German Espinosa, Junda Huang +3
Recent advances in reinforcement learning (RL) have demonstrated impressive capabilities in complex decision-making tasks. This progress raises a natural question: how do these art…