audio signal processing

Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training

arXiv:2603.16805

summary

The paper introduces a joint training method that combines audio watermarking with source separation, allowing distinct watermarks to be embedded in individual stems and reliably recovered after the mixture is separated.

Abstract

Modern audio is created by mixing stems from different sources, raising the question: can we independently watermark each stem and recover all watermarks after separation? We study a separation-first, multi-stream watermarking framework --embedding distinct information into stems using unique keys but a shared structure, mixing, separating, and decoding from each output. A naive pipeline (robust watermarking + off-the-shelf separation) yields poor bit recovery, showing robustness to generic distortions does not ensure robustness to separation artifacts. To enable this, we study separation-aware watermarking in a controlled verification pipeline, where the separator is part of the detector and can be selected or optimized together with the watermarking system. Experiments on speech+music and vocal+accompaniment mixtures show substantial gains in post-separation recovery while maintaining perceptual quality.

Topics & keywords

#audio watermarking#source separation#joint training#multi‑stream embedding#robustnessstem-level watermarkingseparation‑aware watermarkingjoint optimizationbit recoveryperceptual quality
Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training · wovepaper