From the 1 of 12 linked papers with an AI index.
12 papers
SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs
Jian Yu, Fei Shen, Cong Wang +6
Although Large Language Models (LLMs) have demonstrated promising safety performance, extending them to Multimodal Large Language Models (MLLMs) exposes a significant gap between e…
One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs
Enyi Shi, Fei Shen, Chuancheng Shi +4
The paper introduces a neuron‑level safety alignment method that identifies and updates a tiny set of shared safety neurons across languages and modalities, enabling large vision‑l…
MAB-DQA: Addressing Query Aspect Importance in Document Question Answering with Multi-Armed Bandits
Yixin Xiang, Yunshan Ma, Xiaoyu Du +3
Document Question Answering (DQA) involves generating answers from a document based on a user's query, representing a key task in document understanding. This task requires interpr…
Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models
Enyi Shi, Fei Shen, Shuyi Miao +5
With the widespread deployment of vision-language large models (VLLMs), their safety alignment faces dual challenges across languages and modalities. Existing methods model multili…
VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis
Jian Yu, Fei Shen, Cong Wang +4
Diffusion models have driven remarkable advancements in fashion image generation, yet prior works usually treat garment generation and virtual dressing as separate problems, limiti…
IMAGHarmony: Controllable Image Editing with Consistent Object Quantity and Layout
Fei Shen, Yutong Gao, Jian Yu +2
Despite advances in diffusion-based image editing, manipulating multi-object scenes remains challenging. Existing approaches often achieve semantic changes at the expense of struct…