2 papers
cs.LG2026
ReGuide: From Test-Time Guidance to Self-Improving Diffusion Policies
Tzu-Hsiang Lin, Srinivas Shakkottai, Dileep Kalathil +1
Behavior-cloned diffusion policies are expressive but remain vulnerable to covariate shift: small deviations from demonstrated states can compound into task failure. Existing metho…
cs.LG2026
Optimistic World Models: Efficient Exploration in Model-Based Deep Reinforcement Learning
Akshay Mete, Shahid Aamir Sheikh, Tzu-Hsiang Lin +2
Efficient exploration remains a central challenge in reinforcement learning (RL), particularly in sparse-reward environments. We introduce Optimistic World Models (OWMs), a princip…