3 papers
cs.CV2025
From Local Details to Global Context: Advancing Vision-Language Models with Attention-Based Selection
Lincan Cai, Jingxuan Kang, Shuang Li +4
Pretrained vision-language models (VLMs), e.g., CLIP, demonstrate impressive zero-shot capabilities on downstream tasks. Prior research highlights the crucial role of visual augmen…
cs.CV2025
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion
Junxian Ma, Shiwen Wang, Jian Yang +6
Recent advances in diffusion models have led to significant progress in audio-driven lip synchronization. However, existing methods typically rely on constrained audio-visual align…
cs.CV2025
Exploring Structured Semantic Priors Underlying Diffusion Score for Test-time Adaptation
Mingjia Li, Shuang Li, Tongrui Su +3
Capitalizing on the complementary advantages of generative and discriminative models has always been a compelling vision in machine learning, backed by a growing body of research.…