1 paper
Tianchi Zhao, He Liu, Hongyin Shi +1
We study a type of Multi-Armed Bandit (MAB) problems in which arms with a Gaussian reward feedback are clustered. Such an arm setting finds applications in many real-world problems…