7 papers
Understanding Performance Collapse in Layer-Pruned Large Language Models via Decision Representation Transitions
Boyu Shi, Chang Liu, ChuanBao Gao +2
Layer pruning efficiently reduces Large Language Model (LLM) computational costs but often triggers sudden performance collapse. Existing representation-based analyses struggle to…
Enhancing Multimodal In-Context Learning for Image Classification through Coreset Optimization
Huiyi Chen, Jiawei Peng, Kaihua Tang +2
In-context learning (ICL) enables Large Vision-Language Models (LVLMs) to adapt to new tasks without parameter updates, using a few demonstrations from a large support set. However…
Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge
Ruiming Chen, Junming Yang, Shiyu Xia +3
CLIP (Contrastive Language-Image Pre-training) has attracted widespread attention for its multimodal generalizable knowledge, which is significant for downstream tasks. However, th…
Fast Large Language Model Collaborative Decoding via Speculation
Jiale Fu, Yuchu Jiang, Junkai Chen +3
Large Language Model (LLM) collaborative decoding techniques improve output quality by combining the outputs of multiple models at each generation step, but they incur high computa…
Mimic In-Context Learning for Multimodal Tasks
Yuchu Jiang, Jiale Fu, Chenduo Hao +4
Recently, In-context Learning (ICL) has become a significant inference paradigm in Large Multimodal Models (LMMs), utilizing a few in-context demonstrations (ICDs) to prompt LMMs f…
LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL
Yingzhe Peng, Gongrui Zhang, Miaosen Zhang +7
Enhancing reasoning in Large Multimodal Models (LMMs) faces unique challenges from the complex interplay between visual perception and logical reasoning, particularly in compact 3B…