3 papers
cs.RO2026
Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning
Varun Giridhar, Anant Khandelwal, Jeremy A. Collins +2
Behaviour Cloning (BC) has driven remarkable progress in robot manipulation, yet it is fundamentally limited by its inability to self-improve: a policy that fails cannot learn from…
cs.RO2025
Learning Deployable Locomotion Control via Differentiable Simulation
Clemens Schwarke, Victor Klemm, Joshua Bagajo +4
Differentiable simulators promise to improve sample efficiency in robot learning by providing analytic gradients of the system dynamics. Yet, their application to contact-rich task…
cs.LG2025
PWM: Policy Learning with Multi-Task World Models
Ignat Georgiev, Varun Giridhar, Nicklas Hansen +1
Reinforcement Learning (RL) has made significant strides in complex tasks but struggles in multi-task settings with different embodiments. World model methods offer scalability by…