Showing cs.LGShow all
2 papers · 1 filter
cs.LG2025
Value from Observations: Towards Large-Scale Imitation Learning via Self-Improvement
Michael Bloesch, Markus Wulfmeier, Philemon Brakel +8
Imitation Learning from Observation (IfO) offers a powerful way to learn behaviors at large-scale: Unlike behavior cloning or offline reinforcement learning, IfO can leverage actio…
cs.LG2025
Learning from negative feedback, or positive feedback or both
Abbas Abdolmaleki, Bilal Piot, Bobak Shahriari +9
Existing preference optimization methods often assume scenarios where paired preference feedback (preferred/positive vs. dis-preferred/negative examples) is available. This require…