Showing cs.LGShow all
2 papers · 1 filter
cs.LG2023
Preference as Reward, Maximum Preference Optimization with Importance Sampling
Zaifan Jiang, Xing Huang, Chao Wei
Preference learning is a key technology for aligning language models with human values. Reinforcement Learning from Human Feedback (RLHF) is a model-based algorithm to optimize pre…
cs.LG2019
Optimal Delivery with Budget Constraint in E-Commerce Advertising
Chao Wei, Weiru Zhang, Shengjie Sun +4
Online advertising in E-commerce platforms provides sellers an opportunity to achieve potential audiences with different target goals. Ad serving systems (like display and search a…