Showing 2024Show all
2 papers · 1 filter
cs.LG2024
Robust Offline Reinforcement Learning for Non-Markovian Decision Processes
Ruiquan Huang, Yingbin Liang, Jing Yang
Distributionally robust offline reinforcement learning (RL) aims to find a policy that performs the best under the worst environment within an uncertainty set using an offline data…
cs.LG2024
Non-asymptotic Convergence of Training Transformers for Next-token Prediction
Ruiquan Huang, Yingbin Liang, Jing Yang
Transformers have achieved extraordinary success in modern machine learning due to their excellent ability to handle sequential data, especially in next-token prediction (NTP) task…