collaborators

7 papers

cs.CV2026

Continual Video-MLLM Adaptation over Evolving Domains

Rui Cheng, Meixing Shi, Yuxiang Cai +3

Video multimodal large language models have shown strong capability in video understanding, yet their adaptation to sequentially evolving domains remains underexplored. In real-wor…

cs.CV2026

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

Bin Chen, Yuxiang Cai, Yadan Luo +3

Reducing visual token redundancy is critical for accelerating Multimodal Large Language Models (MLLMs) without degrading cross-modal reasoning performance. Existing token pruning m…

cs.CV2026

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

Zengjie Chen, Yuxiang Cai, Jingcai Guo +3

Visual token reduction has emerged as an effective strategy for accelerating Multimodal Large Language Models (MLLMs). Many existing methods prune tokens by ranking text-visual att…

cs.IR2026

SRSUPM: Sequential Recommender System Based on User Psychological Motivation

Yicheng Di, Yuan Liu, Zhi Chen +1

Sequential recommender infers users' evolving psychological motivations from historical interactions to recommend the next preferred items. Most existing methods compress recent be…

cs.CV2026

Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection

Wanqi Wang, Jingcai Guo, Yuxiang Cai +1

Cross-Domain Few-Shot Object Detection (CD-FSOD) aims to detect novel classes in unseen target domains given only a few labeled examples. While open-vocabulary detectors built on v…

cs.CV2025

Fine-Grained Zero-Shot Learning with Attribute-Centric Representations

Zhi Chen, Jingcai Guo, Taotao Cai +1

Recognizing unseen fine-grained categories demands a model that can distinguish subtle visual differences. This is typically achieved by transferring visual-attribute relationships…