1 paper
Akhila Vangara, Alex Egg
Uniform random exploration in decision-making systems supports off-policy learning via supervision but incurs high regret, making it impractical for many applications. Conversely,…