works on

From the 1 of 12 linked papers with an AI index.

activity
20242026
collaborators

12 papers

cs.CV2026

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

Jian Yu, Fei Shen, Cong Wang +6

Although Large Language Models (LLMs) have demonstrated promising safety performance, extending them to Multimodal Large Language Models (MLLMs) exposes a significant gap between e…

cs.AI2026

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

Enyi Shi, Fei Shen, Chuancheng Shi +4

The paper introduces a neuron‑level safety alignment method that identifies and updates a tiny set of shared safety neurons across languages and modalities, enabling large vision‑l…

cs.CL2026

MAB-DQA: Addressing Query Aspect Importance in Document Question Answering with Multi-Armed Bandits

Yixin Xiang, Yunshan Ma, Xiaoyu Du +3

Document Question Answering (DQA) involves generating answers from a document based on a user's query, representing a key task in document understanding. This task requires interpr…

cs.CV2026

Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models

Enyi Shi, Fei Shen, Shuyi Miao +5

With the widespread deployment of vision-language large models (VLLMs), their safety alignment faces dual challenges across languages and modalities. Existing methods model multili…

cs.CV2026

VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis

Jian Yu, Fei Shen, Cong Wang +4

Diffusion models have driven remarkable advancements in fashion image generation, yet prior works usually treat garment generation and virtual dressing as separate problems, limiti…

cs.CV2026

IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout

Fei Shen, Yutong Gao, Jian Yu +2

Despite advances in diffusion-based image editing, manipulating multi-object scenes remains challenging. Existing approaches often achieve semantic changes at the expense of struct…