1 paper · 1 filter
Aurelien Bibaut, Houssam Zenati, Thibaud Rahier +1
We propose a cross-fitted debiasing device for policy learning from offline data. A key consequence of the resulting learning principle is N regret even for policy classes…