3 papers
cs.LG2026
PriPG-RL: Privileged Planner-Guided Reinforcement Learning for Partially Observable Systems with Anytime-Feasible MPC
Mohsen Amiri, Ali Beikmohammadi, Sindri Magnuśson +1
This paper addresses the problem of training a reinforcement learning (RL) policy under partial observability by exploiting a privileged, anytime-feasible planner agent available e…
cs.LG2025
MARBLE: Multi-Armed Restless Bandits in Latent Markovian Environment
Mohsen Amiri, Konstantin Avrachenkov, Ibtihal El Mimouni +1
Restless Multi-Armed Bandits (RMABs) are powerful models for decision-making under uncertainty, yet classical formulations typically assume fixed dynamics, an assumption often viol…
cs.LG2025
Challenger-Based Combinatorial Bandits for Subcarrier Selection in OFDM Systems
Mohsen Amiri, V Venktesh, Sindri Magnússon
This paper investigates the identification of the top-m user-scheduling sets in multi-user MIMO downlink, which is cast as a combinatorial pure-exploration problem in stochastic li…