1 paper · 1 filter
Zhengxu He, Jun Li, Zhijian Wu
Large-scale Vision-Language Models (VLMs) encode rich multimodal semantics that are highly beneficial for fine-grained visual categorization (FGVC). However, their prohibitive comp…