1 paper · 1 filter
Haochen Wu, Yi Hou, Shiguang Xie
Dispatch in three-sided marketplaces provides a natural setting for reinforcement learning from world feedback: decisions are evaluated by delayed operational outcomes such as deli…