5 papers
Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation
Xusheng Liang, Lihua Zhou, Nianxin Li +8
Vision-Language Models (VLMs), such as CLIP, have demonstrated remarkable zero-shot capabilities in various computer vision tasks. However, their application to medical imaging rem…
Reward-Guided Semantic Evolution for Test-time Adaptive Object Detection
Lihua Zhou, Mao Ye, Xiatian Zhu +7
Open-vocabulary object detection with vision-language models (VLMs) such as Grounding DINO suffers from performance degradation under test-time distribution shifts, primarily due t…
Bayesian Test-time Adaptation for Object Recognition and Detection with Vision-language Models
Lihua Zhou, Mao Ye, Shuaifeng Li +7
Vision-language models (VLMs) such as CLIP and Grounding DINO have achieved remarkable success in object recognition and detection. However, their performance often degrades under…
Text-Driven Causal Representation Learning for Source-Free Domain Generalization
Lihua Zhou, Mao Ye, Nianxin Li +7
Deep learning often struggles when training and test data distributions differ. Traditional domain generalization (DG) tackles this by including data from multiple source domains,…
Bayesian Test-Time Adaptation for Vision-Language Models
Lihua Zhou, Mao Ye, Shuaifeng Li +5
Test-time adaptation with pre-trained vision-language models, such as CLIP, aims to adapt the model to new, potentially out-of-distribution test data. Existing methods calculate th…