2 papers
cs.RO2026
Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning
Varun Giridhar, Anant Khandelwal, Jeremy A. Collins +2
Behaviour Cloning (BC) has driven remarkable progress in robot manipulation, yet it is fundamentally limited by its inability to self-improve: a policy that fails cannot learn from…
cs.LG2025
PWM: Policy Learning with Multi-Task World Models
Ignat Georgiev, Varun Giridhar, Nicklas Hansen +1
Reinforcement Learning (RL) has made significant strides in complex tasks but struggles in multi-task settings with different embodiments. World model methods offer scalability by…