2 papers
cs.AI2025
Offline Safe Policy Optimization From Heterogeneous Feedback
Ze Gong, Pradeep Varakantham, Akshat Kumar
Offline Preference-based Reinforcement Learning (PbRL) learns rewards and policies aligned with human preferences without the need for extensive reward engineering and direct inter…
cs.LG2025
Offline Safe Reinforcement Learning Using Trajectory Classification
Ze Gong, Akshat Kumar, Pradeep Varakantham
Offline safe reinforcement learning (RL) has emerged as a promising approach for learning safe behaviors without engaging in risky online interactions with the environment. Most ex…