Showing cs.LGShow all
2 papers · 1 filter
cs.LG2023
Tackling Heavy-Tailed Rewards in Reinforcement Learning with Function Approximation: Minimax Optimal and Instance-Dependent Regret Bounds
Jiayi Huang, Han Zhong, Liwei Wang +1
While numerous works have focused on devising efficient algorithms for reinforcement learning (RL) with uniformly bounded rewards, it remains an open question whether sample or tim…
cs.LG2023
A Reduction-based Framework for Sequential Decision Making with Delayed Feedback
Yunchang Yang, Han Zhong, Tianhao Wu +3
We study stochastic delayed feedback in general multi-agent sequential decision making, which includes bandits, single-agent Markov decision processes (MDPs), and Markov games (MGs…