1 paper
Haoji Zhang, Yiqin Wang, Yansong Tang +4
Benefiting from the advancements in large language models and cross-modal alignment, existing multi-modal video understanding methods have achieved prominent performance in offline…