4 papers
Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions?
Yuzhi Tang, Wentao Ma, Xiling Zhao +17
Current full-duplex (FD) spoken dialogue systems can produce fluid interactions, yet it remains unclear whether they can adapt their turn-taking behavior when explicitly instructed…
Persian MusicGen: A Large-Scale Dataset and Culturally-Aware Generative Model for Persian Music
Mohammad Hossein Sameti, Diba Hadi Esfangereh, Sepehr Harfi Moridani +2
Persian music, with its unique tonalities, modal systems (Dastgah), and rhythmic structures, presents significant challenges for music generation models trained primarily on Wester…
Persian Musical Instruments Classification Using Polyphonic Data Augmentation
Diba Hadi Esfangereh, Mohammad Hossein Sameti, Sepehr Harfi Moridani +2
Musical instrument classification is essential for music information retrieval (MIR) and generative music systems. However, research on non-Western traditions, particularly Persian…
Accent-Invariant Automatic Speech Recognition via Saliency-Driven Spectrogram Masking
Mohammad Hossein Sameti, Sepehr Harfi Moridani, Ali Zarean +1
Pre-trained transformer-based models have significantly advanced automatic speech recognition (ASR), yet they remain sensitive to accent and dialectal variations, resulting in elev…