3 papers
cs.CV2026
Fine-tuning MLLMs Without Forgetting Is Easier Than You Think
He Li, Yuhui Zhang, Xiaohan Wang +2
The paper demonstrate that simple adjustments of the fine-tuning recipes of multimodal large language models (MLLM) are sufficient to mitigate catastrophic forgetting. On visual qu…
cs.CV2025
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
Jiyang Tang, Hengyi Li, Yifan Du +1
Although video multimodal large language models (video MLLMs) have achieved substantial progress in video captioning tasks, it remains challenging to adjust the focal emphasis of v…
cs.CV2025
EmoAssist: Emotional Assistant for Visual Impairment Community
Xingyu Qi, He Li, Linjie Li +1
The rapid advancement of large multi-modality models (LMMs) has significantly propelled the integration of artificial intelligence into practical applications. Visual Question Answ…