activity
20242026
collaborators

5 papers

cs.LG2026

From Relative Entropy to Minimax: A Unified Framework for Coverage in MDPs

Xihe Gu, Urbashi Mitra, Tara Javidi

Targeted and deliberate exploration of state--action pairs is essential in reward-free Markov Decision Problems (MDPs). More precisely, different state-action pairs exhibit differe…

cs.LG2025

Partially Decentralized Multi-Agent Q-Learning via Digital Cousins for Wireless Networks

Talha Bozkus, Urbashi Mitra

Q-learning is a widely used reinforcement learning (RL) algorithm for optimizing wireless networks, but faces challenges with large state-spaces. Recently proposed multi-environmen…

cs.LG2024

Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning

Talha Bozkus, Tara Javidi, Urbashi Mitra

Q-learning is widely employed for optimizing various large-dimensional networks with unknown system dynamics. Recent advancements include multi-environment mixed Q-learning (MEMQ)…

eess.SP2024

A Multi-Agent Multi-Environment Mixed Q-Learning for Partially Decentralized Wireless Network Optimization

Talha Bozkus, Urbashi Mitra

Q-learning is a powerful tool for network control and policy optimization in wireless networks, but it struggles with large state spaces. Recent advancements, like multi-environmen…

eess.SP2024

Coverage Analysis of Multi-Environment Q-Learning Algorithms for Wireless Network Optimization

Talha Bozkus, Urbashi Mitra

Q-learning is widely used to optimize wireless networks with unknown system dynamics. Recent advancements include ensemble multi-environment hybrid Q-learning algorithms, which uti…