1 paper · 1 filter
Udita Ghosh, Dripta S. Raychaudhuri, Jiachen Li +2
Preference-based reinforcement learning can learn effective reward functions from comparisons, but its scalability is constrained by the high cost of oracle feedback. Lightweight v…