3 papers
cs.CV2026
StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
Shaokun Wang, Weili Guan, Jizhou Han +3
Continual Text-to-Video Retrieval (CTVR) is a challenging multimodal continual learning setting, where models must incrementally learn new semantic categories while maintaining acc…
cs.CV2026
IOTA: Corrective Knowledge-Guided Prompt Learning via Black-White Box Framework
Shaokun Wang, Yifan Yu, Yuhang He +2
Recently, adapting pre-trained models to downstream tasks has attracted increasing interest. Previous Parameter-Efficient-Tuning (PET) methods regard the pre-trained model as an op…
cs.CL2025
Cross-Granularity Hypergraph Retrieval-Augmented Generation for Multi-hop Question Answering
Changjian Wang, Weihong Deng, Weili Guan +2
Multi-hop question answering (MHQA) requires integrating knowledge scattered across multiple passages to derive the correct answer. Traditional retrieval-augmented generation (RAG)…