2 papers
cs.CV2026
LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs
Jingfeng Chen, Jiawen Qian, Wendi Deng +5
Video understanding in multimodal large language models requires selecting informative frames from long, redundant videos under limited visual-token budgets. Existing methods often…
cs.AI2024
MCSFF: Multi-modal Consistency and Specificity Fusion Framework for Entity Alignment
Wei Ai, Wen Deng, Hongyi Chen +3
Multi-modal entity alignment (MMEA) is essential for enhancing knowledge graphs and improving information retrieval and question-answering systems. Existing methods often focus on…