7 papers
Continual Video-MLLM Adaptation over Evolving Domains
Rui Cheng, Meixing Shi, Yuxiang Cai +3
Video multimodal large language models have shown strong capability in video understanding, yet their adaptation to sequentially evolving domains remains underexplored. In real-wor…
Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models
Bin Chen, Yuxiang Cai, Yadan Luo +3
Reducing visual token redundancy is critical for accelerating Multimodal Large Language Models (MLLMs) without degrading cross-modal reasoning performance. Existing token pruning m…
Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction
Zengjie Chen, Yuxiang Cai, Jingcai Guo +3
Visual token reduction has emerged as an effective strategy for accelerating Multimodal Large Language Models (MLLMs). Many existing methods prune tokens by ranking text-visual att…
SRSUPM: Sequential Recommender System Based on User Psychological Motivation
Yicheng Di, Yuan Liu, Zhi Chen +1
Sequential recommender infers users' evolving psychological motivations from historical interactions to recommend the next preferred items. Most existing methods compress recent be…
Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection
Wanqi Wang, Jingcai Guo, Yuxiang Cai +1
Cross-Domain Few-Shot Object Detection (CD-FSOD) aims to detect novel classes in unseen target domains given only a few labeled examples. While open-vocabulary detectors built on v…
Fine-Grained Zero-Shot Learning with Attribute-Centric Representations
Zhi Chen, Jingcai Guo, Taotao Cai +1
Recognizing unseen fine-grained categories demands a model that can distinguish subtle visual differences. This is typically achieved by transferring visual-attribute relationships…