1 paper · 1 filter
Sokipriala Jonah, Seong Ki Yoo, Saurav Sthapit
We propose a reinforcement learning based scheduling framework for Restless Multi-Armed Bandit (RMAB) problems, centred on a Whittle Index Q-Learning policy with Upper Confidence B…