Christopher Kelly, Angelica Chowdhury, Alexandra Campili +5
This work establishes a framework for standardizing AI evaluation RCTs (sometimes called human uplift studies). Drawing on established practices from disciplines with established R…