Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
A Practical Algorithm for Feature-Rich, Non-Stationary Bandit Problems
Wei Min Loh, Sajib Kumer Sinha, Ankur Agarwal +1
Contextual bandits are incredibly useful in many practical problems. We go one step further by devising a more realistic problem that combines: (1) contextual bandits with dense ar…
cs.LG2025
A Minimalist Method for Fine-tuning Text-to-Image Diffusion Models
Yanting Miao, William Loh, Pacal Poupart +1
Recent work uses reinforcement learning (RL) to fine-tune text-to-image diffusion models, improving text-image alignment and sample quality. However, existing approaches introduce…