1 paper
Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler +1
Robots can adapt to user preferences by learning reward functions from demonstrations, but with limited data, reward models often overfit to spurious correlations and fail to gener…