3 papers
cs.CV2026
1.x-Distill: Breaking the Diversity, Quality, and Efficiency Barrier in Distribution Matching Distillation
Haoyu Li, Tingyan Wen, Lin Qi +6
Diffusion models produce high-quality text-to-image results, but their iterative denoising is computationally expensive.Distribution Matching Distillation (DMD) emerges as a promis…
cs.LG2025
AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization
Longxiang He, Li Shen, Xueqian Wang
Implicit Q-learning (IQL) serves as a strong baseline for offline RL, which learns the value function using only dataset actions through quantile regression. However, it is unclear…
cs.LG2025
Safety Reasoning with Guidelines
Haoyu Wang, Zeyu Qin, Li Shen +3
Training safe LLMs remains a critical challenge. The most widely used method, Refusal Training (RT), struggles to generalize against various Out-of-Distribution (OOD) jailbreaking…