1 paper · 1 filter
Anthony Liang, Yigit Korkmaz, Jiahui Zhang +14
General-purpose robot reward models are typically trained to predict absolute task progress from expert demonstrations, providing only local, frame-level supervision. While effecti…