4 papers
On the Adversarial Robustness of Multimodal LLM Judges
Zihan Wang, Guansong Pang, Zelin Liu +3
Multimodal Large Language Models (MLLMs) are increasingly used as automated judges, e.g., for image quality and safety assessment. However, their adversarial robustness remains lar…
MTAttack: Multi-Target Backdoor Attacks against Large Vision-Language Models
Zihan Wang, Guansong Pang, Wenjun Miao +2
Recent advances in Large Visual Language Models (LVLMs) have demonstrated impressive performance across various vision-language tasks by leveraging large-scale image-text pretraini…
NVSMask3D: Hard Visual Prompting with Camera Pose Interpolation for 3D Open Vocabulary Instance Segmentation
Junyuan Fang, Zihan Wang, Yejun Zhang +3
Vision-language models (VLMs) have demonstrated impressive zero-shot transfer capabilities in image-level visual perception tasks. However, they fall short in 3D instance-level seg…
Gaussian Splatting in Mirrors: Reflection-Aware Rendering via Virtual Camera Optimization
Zihan Wang, Shuzhe Wang, Matias Turkulainen +2
Recent advancements in 3D Gaussian Splatting (3D-GS) have revolutionized novel view synthesis, facilitating real-time, high-quality image rendering. However, in scenarios involving…