2 papers
cs.LG2025
OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models
Shengkai Chen, Yifang Yin, Jinming Cao +3
Audio-visual segmentation aims to separate sounding objects from videos by predicting pixel-level masks based on audio signals. Existing methods primarily concentrate on closed-set…
cs.AI2024
Red Teaming Visual Language Models
Mukai Li, Lei Li, Yuwei Yin +3
VLMs (Vision-Language Models) extend the capabilities of LLMs (Large Language Models) to accept multimodal inputs. Since it has been verified that LLMs can be induced to generate h…