5 papers
TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels
Siow Meng Low, Ze Gong, Akshat Kumar
Ensuring safe behavior in reinforcement learning (RL) is challenging when safety constraints are implicit and cannot be densely measured. In many settings, supervision is limited t…
Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning
Janaka Chathuranga Brahmanage, Akshat Kumar
Sequential decision making using Markov Decision Process underpins many realworld applications. Both model-based and model free methods have achieved strong results in these settin…
Offline Safe Policy Optimization From Heterogeneous Feedback
Ze Gong, Pradeep Varakantham, Akshat Kumar
Offline Preference-based Reinforcement Learning (PbRL) learns rewards and policies aligned with human preferences without the need for extensive reward engineering and direct inter…
Offline Safe Reinforcement Learning Using Trajectory Classification
Ze Gong, Akshat Kumar, Pradeep Varakantham
Offline safe reinforcement learning (RL) has emerged as a promising approach for learning safe behaviors without engaging in risky online interactions with the environment. Most ex…
Leveraging Constraint Violation Signals For Action-Constrained Reinforcement Learning
Janaka Chathuranga Brahmanage, Jiajing Ling, Akshat Kumar
In many RL applications, ensuring an agent's actions adhere to constraints is crucial for safety. Most previous methods in Action-Constrained Reinforcement Learning (ACRL) employ a…