2 papers
cs.LG2026
Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear -Realizability and Concentrability
Volodymyr Tkachuk, Csaba Szepesvári, Xiaoqi Tan
We study finite-horizon offline reinforcement learning (RL) with function approximation for both policy evaluation and policy optimization. Prior work established that statisticall…
cs.LG2024
Almost Free: Self-concordance in Natural Exponential Families and an Application to Bandits
Shuai Liu, Alex Ayoub, Flore Sentenac +2
We prove that single-parameter natural exponential families with subexponential tails are self-concordant with polynomial-sized parameters. For subgaussian natural exponential fami…