9 papers
Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale
Yanhua Cheng, Bo Wang, Haotian Zhang +17
Traditional short-video recommendation systems match user interest to a fixed pool of pre-produced videos, which limits their ability to capture fine-grained and dynamic preference…
LPT: Less-overfitting Prompt Tuning for Vision-Language Model
Chenhao Ding, Xinyuan Gao, Songlin Dong +5
Vision-language models (VLMs) have demonstrated exceptional generalization capabilities for downstream tasks. Due to its efficiency, prompt learning has gradually become a more eff…
Unleashing the Potential of All Test Samples: Mean-Shift Guided Test-Time Adaptation
Jizhou Han, Chenhao Ding, SongLin Dong +3
Visual-language models (VLMs) like CLIP exhibit strong generalization but struggle with distribution shifts at test time. Existing training-free test-time adaptation (TTA) methods…
Learn by Reasoning: Analogical Weight Generation for Few-Shot Class-Incremental Learning
Jizhou Han, Chenhao Ding, Yuhang He +4
Few-shot class-incremental Learning (FSCIL) enables models to learn new classes from limited data while retaining performance on previously learned classes. Traditional FSCIL metho…
Consistent Supervised-Unsupervised Alignment for Generalized Category Discovery
Jizhou Han, Shaokun Wang, Yuhang He +5
Generalized Category Discovery (GCD) focuses on classifying known categories while simultaneously discovering novel categories from unlabeled data. However, previous GCD methods fa…
VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection
Qiang Wang, Xinyuan Gao, SongLin Dong +5
Existing Video Detailed Captioning (VDC) methods predominantly rely on costly human annotations or distillation from powerful proprietary models, creating a dependency on external…