4 papers
Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations
Simon Holk, Ryosuke Takanami, Tatsuya Matsushima +4
Robot demonstration datasets used to train vision-language-action policies can contain a subtle but harmful failure mode: trajectories that are behaviorally correct but paired with…
The Impact of VR and 2D Interfaces on Human Feedback in Preference-Based Robot Learning
Jorge de Heuvel, Daniel Marta, Simon Holk +2
Aligning robot navigation with human preferences is essential for ensuring comfortable, and predictable robot movement in shared spaces. While preference-based learning methods, su…
Retrieve-Augmented Generation for Speeding up Diffusion Policy without Additional Training
Sodtavilan Odonchimed, Tatsuya Matsushima, Simon Holk +2
Diffusion Policies (DPs) have attracted attention for their ability to achieve significant accuracy improvements in various imitation learning tasks. However, DPs depend on Diffusi…
FLoRA: Sample-Efficient Preference-based RL via Low-Rank Style Adaptation of Reward Functions
Daniel Marta, Simon Holk, Miguel Vasco +6
Preference-based reinforcement learning (PbRL) is a suitable approach for style adaptation of pre-trained robotic behavior: adapting the robot's policy to follow human user prefere…