2 papers
cs.LG2026
FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
Fatemeh Nourzad, Amirhossein Roknilamouki, Eylem Ekici +2
Aligning Large Language Models (LLMs) with human values often involves balancing multiple, conflicting objectives such as helpfulness and harmlessness. Training these models is com…
cs.LG2025
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
Amirhossein Roknilamouki, Arnob Ghosh, Ming Shi +3
In Reinforcement Learning (RL), tasks with instantaneous hard constraints present significant challenges, particularly when the decision space is non-convex or non-star-convex. Thi…