4 papers
Off-Policy Evaluation for Missingness-Aware Policies in MDPs with Rewards Missing Not at Random
Ziheng Wei, Annie Qu, Rui Miao
In offline Reinforcement Learning, immediate rewards in logged batch data are often unobserved due to sparse or irregular record-keeping, or censored beyond certain reward values.…
TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing
Yuanpeng Li, Gefei Lin, Annie Qu +1
Soft Actor-Critic (SAC) and its variants dominate Multi-Task Reinforcement Learning (MTRL) due to their off-policy sample efficiency, while on-policy methods such as Proximal Polic…
Reinforcement Learning for Individual Optimal Policy from Heterogeneous Data
Rui Miao, Babak Shahbaba, Annie Qu
Offline reinforcement learning (RL) aims to find optimal policies in dynamic environments in order to maximize the expected total rewards by leveraging pre-collected data. Learning…
Meta Fusion: A Unified Framework For Multimodality Fusion with Mutual Learning
Ziyi Liang, Annie Qu, Babak Shahbaba
Developing effective multimodal data fusion strategies has become increasingly essential for improving the predictive power of statistical machine learning methods across a wide ra…