3 papers
cs.LG2026
Escaping Offline Pessimism: Vector-Field Reward Shaping for Safe Frontier Exploration
Amirhossein Roknilamouki, Arnob Ghosh, Eylem Ekici +1
While offline reinforcement learning provides reliable policies for real-world deployment, its inherent pessimism severely restricts an agent's ability to explore and collect novel…
cs.LG2025
FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
Fatemeh Nourzad, Amirhossein Roknilamouki, Eylem Ekici +2
Aligning Large Language Models (LLMs) with human values often involves balancing multiple, conflicting objectives such as helpfulness and harmlessness. Training these models is com…
cs.LG2025
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
Amirhossein Roknilamouki, Arnob Ghosh, Ming Shi +3
In Reinforcement Learning (RL), tasks with instantaneous hard constraints present significant challenges, particularly when the decision space is non-convex or non-star-convex. Thi…