collaborators

7 papers

cs.CV2026

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun +5

Text-to-image (T2I) models can produce visually compelling images, yet they remain limited on open-world tasks that require complex semantic understanding, multi-step reasoning, an…

cs.CV2026

Structured Evidence Selection for Weakly Supervised Video Anomaly Detection

Chenglizhao Chen, Tianxiang Nan, Wen Li +4

Weakly supervised video anomaly detection relies solely on video-level labels for training, making it difficult to accurately localize anomalous events in complex scenes. In real-w…

cs.CV2026

Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models

Xiaomin Yu, Yi Xin, Yuhui Zhang +12

Despite the success of multimodal contrastive learning in aligning visual and linguistic representations, a persistent geometric anomaly, the Modality Gap, remains: embeddings of d…

cs.AI2026

Text-Only Data Synthesis for Vision Language Model Training

Xiaomin Yu, Wenjie Zhang, Ziyue Qiao +2

Training vision-language models (VLMs) typically requires large-scale, high-quality image-text pairs, but collecting or synthesizing such data is costly. In contrast, text data is…

cs.CV2026

Controlling Decision Drift in Multimodal Sentiment Analysis with Missing Modalities

Chenglizhao Chen, Yuchen Cao, Xinyu Liu +3

Multimodal sentiment analysis relies on textual, acoustic, and visual signals, yet real-world data often suffer from modality missing and quality imbalance. Existing methods genera…

cs.MM2026

Anisotropic Modality Align

Xiaomin Yu, Yijiang Li, Yuhui Zhang +8

Training multimodal large language models has long been limited by the scarcity of high-quality paired multimodal data. Recent studies show that the shared representation space of…