1 paper
Jorge de Heuvel, Florian Seiler, Maren Bennewitz
To align mobile robot navigation policies with user preferences through reinforcement learning from human feedback (RLHF), reliable and behavior-diverse user queries are required.…