2 papers
cs.LG2026
Information-Directed Sampling for Causal Bandits
Muhammad Qasim Elahi, Murat Kocaoglu, Mahsa Ghasemi
Causal bandits exploit structural relationships among variables to share information across interventions and accelerate the identification of high-reward decisions. In many applic…
cs.LG2026
Joint MDPs and Reinforcement Learning in Coupled-Dynamics Environments
Ege C. Kaya, Mahsa Ghasemi, Abolfazl Hashemi
Many distributional quantities in reinforcement learning are intrinsically joint across actions, including distributions of gaps and probabilities of superiority. However, the clas…