2 papers
cs.AI2026
Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
Min Cheng, Fatemeh Doudi, Dileep Kalathil +2
Reinforcement learning (RL) algorithms have been used recently to align diffusion models with downstream objectives such as aesthetic quality and text-image consistency by fine-tun…
cs.LG2024
Q-learning for Quantile MDPs: A Decomposition, Performance, and Convergence Analysis
Jia Lin Hau, Erick Delage, Esther Derman +2
In Markov decision processes (MDPs), quantile risk measures such as Value-at-Risk are a standard metric for modeling RL agents' preferences for certain outcomes. This paper propose…