1 paper
Ziqing Lu, Babak Hassibi, Lifeng Lai +1
Reinforcement learning usually assumes a given or sometimes even fixed environment in which an agent seeks an optimal policy to maximize its long-term discounted reward. In contras…