most citedWeakly Supervised Detection and Temporal Localization of Whale Calls in Long-Duration Bioacoustic Data

1 citations · 1 across the 2 of their papers we have counts for

collaborators

8 papers

cs.SD20261 cited

Weakly Supervised Detection and Temporal Localization of Whale Calls in Long-Duration Bioacoustic Data

Ragib Amin Nihal, Benjamin Yen, Runwu Shi +2

Passive acoustic monitoring (PAM) systems generate continuous recordings spanning months, yet automated bioacoustic analysis of whale calls requires two separate annotation efforts…

cs.SD2026

Ecologically-Constrained Task Arithmetic for Multi-Taxa Bioacoustic Classifiers Without Shared Data

Ragib Amin Nihal, Benjamin Yen, Runwu Shi +2

Training data for bioacoustics is scattered across taxa, regions, and institutions. Centralizing it all is often infeasible. We show that independently fine-tuned BEATs encoders ca…

cs.CL2026

Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models

Ragib Amin Nihal, Rui Wen, Kazuhiro Nakadai +1

Large language models (LLMs) remain vulnerable to multi-turn jailbreaking attacks that exploit conversational context to bypass safety constraints gradually. These attacks target d…

eess.AS2025

Unsupervised Single-Channel Speech Separation with Diffusion under Speaker-Embedding Guidance

Runwu Shi, Kai Li, Chang Li +5

Speech separation is a fundamental task in audio processing, typically addressed with fully supervised systems trained on paired mixtures. While effective, such systems typically r…

cs.SD2025

Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment

Ragib Amin Nihal, Benjamin Yen, Takeshi Ashizawa +1

Multi-channel audio alignment is a key requirement in bioacoustic monitoring, spatial audio systems, and acoustic localization. However, existing methods often struggle to address…

cs.CV2025

Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis

Ragib Amin Nihal, Benjamin Yen, Takeshi Ashizawa +1

Marine mammal vocalization analysis depends on interpreting bioacoustic spectrograms. Vision Language Models (VLMs) are not trained on these domain-specific visualizations. We inve…