4 papers
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
Ragib Amin Nihal, Rui Wen, Kazuhiro Nakadai +1
Large language models (LLMs) remain vulnerable to multi-turn jailbreaking attacks that exploit conversational context to bypass safety constraints gradually. These attacks target d…
Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment
Ragib Amin Nihal, Benjamin Yen, Takeshi Ashizawa +1
Multi-channel audio alignment is a key requirement in bioacoustic monitoring, spatial audio systems, and acoustic localization. However, existing methods often struggle to address…
Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis
Ragib Amin Nihal, Benjamin Yen, Takeshi Ashizawa +1
Marine mammal vocalization analysis depends on interpreting bioacoustic spectrograms. Vision Language Models (VLMs) are not trained on these domain-specific visualizations. We inve…
Single-Channel Target Speech Extraction Utilizing Distance and Room Clues
Runwu Shi, Zirui Lin, Benjamin Yen +3
This paper aims to achieve single-channel target speech extraction (TSE) in enclosures utilizing distance clues and room information. Recent works have verified the feasibility of…