8 papers
SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization
Peiyu Zhuang, Jianquan Yang, Haodong Li +6
Text-driven image editing has advanced rapidly, but reliably localizing these manipulations requires image manipulation localization (IML) models trained on large pixel-annotated d…
Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment
Haobo Wang, Xiaorong Ma, Weiqi Luo +2
Adversarial perturbations can mislead Multimodal Large Language Models (MLLMs) recognize a benign image as a specific target object, posing serious risks in safety-critical scenari…
AttDiff-GAN: A Hybrid Diffusion-GAN Framework for Facial Attribute Editing
Wenmin Huang, Weiqi Luo, Xiaochun Cao +1
Facial attribute editing aims to modify target attributes while preserving attribute-irrelevant content and overall image fidelity. Existing GAN-based methods provide favorable con…
LatRef-Diff: Latent and Reference-Guided Diffusion for Facial Attribute Editing and Style Manipulation
Wenmin Huang, Weiqi Luo, Xiaochun Cao +1
Facial attribute editing and style manipulation are crucial for applications like virtual avatars and photo editing. However, achieving precise control over facial attributes witho…
SDiFL: Stable Diffusion-Driven Framework for Image Forgery Localization
Yang Su, Shunquan Tan, Jiwu Huang
Driven by the new generation of multi-modal large models, such as Stable Diffusion (SD), image manipulation technologies have advanced rapidly, posing significant challenges to ima…
ForensicsSAM: Toward Robust and Unified Image Forgery Detection and Localization Resisting to Adversarial Attack
Rongxuan Peng, Shunquan Tan, Chenqi Kong +3
Parameter-efficient fine-tuning (PEFT) has emerged as a popular strategy for adapting large vision foundation models, such as the Segment Anything Model (SAM) and LLaVA, to downstr…