Showing cs.SDShow all
2 papers · 1 filter
cs.SD2026
wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval
Adhiraj Banerjee, Vipul Arora
Learning discrete speech representations that preserve similarity across variable-length utterances is central to query-by-example spoken term detection (QbE-STD). While wav2tok in…
cs.SD2025
CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents
Adhiraj Banerjee, Vipul Arora
Text-guided sound separation enables flexible audio editing, assistive listening, and open-domain source extraction, but systems such as AudioSep remain too expensive for low-laten…