3 papers
cs.CV2026
Safe Vision-Language Models via Unsafe Weights Manipulation
Moreno D'IncÃ, Elia Peruzzo, Xingqian Xu +3
Vision-language models (VLMs) often inherit the biases and unsafe associations present within their large-scale training dataset. While recent approaches mitigate unsafe behaviors,…
cs.CV2025
IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
Jiayi Guo, Chuanhao Yan, Xingqian Xu +4
Ensuring precise multimodal alignment between diffusion-generated images and input prompts has been a long-standing challenge. Earlier works finetune diffusion weight using high-qu…
cs.CV2025
RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism
Elia Peruzzo, Dejia Xu, Xingqian Xu +2
Video generation is experiencing rapid growth, driven by advances in diffusion models and the development of better and larger datasets. However, producing high-quality videos rema…