3 papers
cs.CV2026
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
Xiaomin Yu, Yi Xin, Yuhui Zhang +12
Despite the success of multimodal contrastive learning in aligning visual and linguistic representations, a persistent geometric anomaly, the Modality Gap, remains: embeddings of d…
cs.AI2026
Text-Only Data Synthesis for Vision Language Model Training
Xiaomin Yu, Wenjie Zhang, Ziyue Qiao +2
Training vision-language models (VLMs) typically requires large-scale, high-quality image-text pairs, but collecting or synthesizing such data is costly. In contrast, text data is…
cs.MM2024
SpikEmo: Enhancing Emotion Recognition With Spiking Temporal Dynamics in Conversations
Xiaomin Yu, Feiyang Wang, Ziyue Qiao
In affective computing, the task of Emotion Recognition in Conversations (ERC) has emerged as a focal area of research. The primary objective of this task is to predict emotional s…