2 papers
cs.CV2026
Understanding Image2Video Domain Shift in Food Segmentation: An Instance-level Analysis on Apples
Keonvin Park, Aditya Pal, Jin Hong Mok
Food segmentation models trained on static images have achieved strong performance on benchmark datasets; however, their reliability in video settings remains poorly understood. In…
cs.CV2025
CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling
Xinze Wang, Chen Chen, Yinfei Yang +5
Mixture-of-Experts (MoE) models are crucial for scaling model capacity while controlling inference costs. While integrating MoE into multimodal models like CLIP improves performanc…