2 papers
cs.LG2024
Off-Policy Evaluation from Logged Human Feedback
Aniruddha Bhargava, Lalit Jain, Branislav Kveton +2
Learning from human feedback has been central to recent advances in artificial intelligence and machine learning. Since the collection of human feedback is costly, a natural questi…
cs.LG2023
Pessimistic Off-Policy Multi-Objective Optimization
Shima Alizadeh, Aniruddha Bhargava, Karthick Gopalswamy +3
Multi-objective optimization is a type of decision making problems where multiple conflicting objectives are optimized. We study offline optimization of multi-objective policies fr…