Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
Fatemeh Nourzad, Amirhossein Roknilamouki, Eylem Ekici +2
Aligning Large Language Models (LLMs) with human values often involves balancing multiple, conflicting objectives such as helpfulness and harmlessness. Training these models is com…
cs.LG2026
Near-Optimal Partially Observable Reinforcement Learning with Partial Online State Information
Ming Shi, Yingbin Liang, Ness B. Shroff
Partially observable Markov decision processes (POMDPs) are a general framework for sequential decision-making under latent state uncertainty, yet learning in POMDPs is intractable…