activity
20242026
collaborators

6 papers

eess.AS2026

FlowW2N: Whispered-to-Normal Speech Conversion via Flow-Matching

Fabian Ritter-Gutierrez, Md Asif Jalal, Pablo Peso Parada +5

Whispered-to-normal (W2N) speech conversion aims to reconstruct missing phonation from whispered input while preserving content and speaker identity. This task is challenging due t…

cs.CL2025

Retrieval Augmented Generation based context discovery for ASR

Dimitrios Siskos, Stavros Papadopoulos, Pablo Peso Parada +3

This work investigates retrieval augmented generation as an efficient strategy for automatic context discovery in context-aware Automatic Speech Recognition (ASR) system, in order…

eess.AS2025

ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization

Haaris Mehmood, Karthikeyan Saravanan, Pablo Peso Parada +5

Automatic Speech Recognition (ASR) is widely used within consumer devices such as mobile phones. Recently, personalization or on-device model fine-tuning has shown that adaptation…

eess.AS2025

Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning

Jisi Zhang, Pablo Peso Parada, Md Asif Jalal +1

Diffusion based Text-To-Music (TTM) models generate music corresponding to text descriptions. Typically UNet based diffusion models condition on text embeddings generated from a pr…

eess.AS2025

persoDA: Personalized Data Augmentation for Personalized ASR

Pablo Peso Parada, Spyros Fontalis, Md Asif Jalal +6

Data augmentation (DA) is ubiquitously used in training of Automatic Speech Recognition (ASR) models. DA offers increased data variability, robustness and generalization against di…

eess.AS2024

Exploring compressibility of transformer based text-to-music (TTM) models

Vasileios Moschopoulos, Thanasis Kotsiopoulos, Pablo Peso Parada +7

State-of-the art Text-To-Music (TTM) generative AI models are large and require desktop or server class compute, making them infeasible for deployment on mobile phones. This paper…