3 papers
cs.LG2026
Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum
Navdeep Kumar, Tehila Dahan, Lior Cohen +4
We establish an optimal sample complexity of for obtaining an -optimal global policy using a single-timescale actor-critic (AC) algorithm in infinite-horizon disco…
cs.LG2026
Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models
Lior Cohen, Ofir Nabati, Kaixin Wang +2
We study diffusion-based world models for reinforcement learning, which offer high generative fidelity but face critical efficiency challenges in control. Current methods either re…
cs.LG2025
Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead
Uri Koren, Navdeep Kumar, Uri Gadot +3
Classical policy gradient (PG) methods in reinforcement learning frequently converge to suboptimal local optima, a challenge exacerbated in large or complex environments. This work…