3 papers
cs.CL2025
Resource-Friendly Dynamic Enhancement Chain for Multi-Hop Question Answering
Binquan Ji, Haibo Luo, Yifei Lu +6
Knowledge-intensive multi-hop question answering (QA) tasks, which require integrating evidence from multiple sources to address complex queries, often necessitate multiple rounds…
cs.CV2025
M-LLM Based Video Frame Selection for Efficient Video Understanding
Kai Hu, Feng Gao, Xiaohan Nie +8
Recent advances in Multi-Modal Large Language Models (M-LLMs) show promising results in video reasoning. Popular Multi-Modal Large Language Model (M-LLM) frameworks usually apply n…
cs.CV2024
Multimodal Instruction Tuning with Hybrid State Space Models
Jianing Zhou, Han Li, Shuai Zhang +5
Handling lengthy context is crucial for enhancing the recognition and understanding capabilities of multimodal large language models (MLLMs) in applications such as processing high…