2 papers
cs.CV2026
CLIP-Map: Structured Matrix Mapping for Parameter-Efficient CLIP Compression
Kangjie Zhang, Wenxuan Huang, Xin Zhou +9
Contrastive Language-Image Pre-training (CLIP) has achieved widely applications in various computer vision tasks, e.g., text-to-image generation, Image-Text retrieval and Image cap…
cs.CV2024
Fusion-Mamba for Cross-modality Object Detection
Wenhao Dong, Haodong Zhu, Shaohui Lin +6
Cross-modality fusing complementary information from different modalities effectively improves object detection performance, making it more useful and robust for a wider range of a…