collaborators

5 papers

cs.CL2025

Retrieval Augmented Generation based context discovery for ASR

Dimitrios Siskos, Stavros Papadopoulos, Pablo Peso Parada +3

This work investigates retrieval augmented generation as an efficient strategy for automatic context discovery in context-aware Automatic Speech Recognition (ASR) system, in order…

cs.SD2025

Robust Target Speaker Diarization and Separation via Augmented Speaker Embedding Sampling

Md Asif Jalal, Luca Remaggi, Vasileios Moschopoulos +7

Traditional speech separation and speaker diarization approaches rely on prior knowledge of target speakers or a predetermined number of participants in audio signals. To address t…

eess.AS2025

ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization

Haaris Mehmood, Karthikeyan Saravanan, Pablo Peso Parada +5

Automatic Speech Recognition (ASR) is widely used within consumer devices such as mobile phones. Recently, personalization or on-device model fine-tuning has shown that adaptation…

eess.AS2025

Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning

Jisi Zhang, Pablo Peso Parada, Md Asif Jalal +1

Diffusion based Text-To-Music (TTM) models generate music corresponding to text descriptions. Typically UNet based diffusion models condition on text embeddings generated from a pr…

eess.AS2025

persoDA: Personalized Data Augmentation for Personalized ASR

Pablo Peso Parada, Spyros Fontalis, Md Asif Jalal +6

Data augmentation (DA) is ubiquitously used in training of Automatic Speech Recognition (ASR) models. DA offers increased data variability, robustness and generalization against di…