4 papers
Leakage-Robust Bayesian Persuasion
Nika Haghtalab, Mingda Qiao, Kunhe Yang
This paper introduces leakage-robust Bayesian persuasion. Situated between public Bayesian persuasion [KG11] (and its multi-receiver variants [CCG23, Xu20]) and private Bayesian pe…
Calibrated Stackelberg Games: Learning Optimal Commitments Against Calibrated Agents
Nika Haghtalab, Chara Podimata, Kunhe Yang
We introduce \emph{Calibrated Stackelberg Games (CSGs)}, a generalization of the standard Stackelberg Games (SGs) framework. In CSGs, a principal repeatedly interacts with an agent…
Pluralistic Leaderboards
Nika Haghtalab, Ariel D. Procaccia, Han Shao +2
Recent leaderboard-based evaluations of large language models aggregate user feedback by fitting a Bradley--Terry model to pairwise comparisons, producing a single global ranking b…
Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?
Paul Gölz, Nika Haghtalab, Kunhe Yang
After pre-training, large language models are aligned with human preferences based on pairwise comparisons. State-of-the-art alignment methods (such as PPO-based RLHF and DPO) are…