3 papers
cs.CV2026
Pan-FM: A Pan-Organ Foundation Model with Saliency-Guided Masking for Missing Robustness
Qiangqiang Wu, Grace McIlvain, Zhou Yu +1
Foundation models (FMs) have shown great promise in medical imaging, but most FMs are trained on unimodal data within isolated domains, such as brain MRI alone. Human aging and dis…
cs.CV2026
M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking
Qiangqiang Wu, Tianyu Yang, Bo Fang +4
Tracking Any Point (TAP) has emerged as a fundamental tool for video understanding. Current approaches adapt Vision Foundation Models (VFMs) like DINOv2 via offline finetuning or t…
cs.CV2025
DropMAE: Learning Representations via Masked Autoencoders with Spatial-Attention Dropout for Temporal Matching Tasks
Qiangqiang Wu, Tianyu Yang, Ziquan Liu +3
This paper studies masked autoencoder (MAE) video pre-training for various temporal matching-based downstream tasks, i.e., object-level tracking tasks including video object tracki…