3 papers
cs.IR2025
Queries Are Not Alone: Clustering Text Embeddings for Video Search
Peyang Liu, Xi Wang, Ziqiang Cui +1
The rapid proliferation of video content across various platforms has highlighted the urgent need for advanced video retrieval systems. Traditional methods, which primarily depend…
cs.LG2025
Mitigating Spurious Correlations with Causal Logit Perturbation
Xiaoling Zhou, Wei Ye, Rui Xie +1
Deep learning has seen widespread success in various domains such as science, industry, and society. However, it is acknowledged that certain approaches suffer from non-robustness,…
cs.CL2024
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
Chaoya Jiang, Jia Hongrui, Haiyang Xu +6
This paper presents MaVEn, an innovative Multi-granularity Visual Encoding framework designed to enhance the capabilities of Multimodal Large Language Models (MLLMs) in multi-image…