1 paper · 1 filter
Dongchi Huang, Hongyin Zhang, Bohan Hou +12
General-purpose reward models are increasingly the bottleneck for scaling robot learning, yet the recipe for learning value-related capabilities from large-scale heterogeneous corp…