2 papers
eess.AS2025
Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning
Jisi Zhang, Pablo Peso Parada, Md Asif Jalal +1
Diffusion based Text-To-Music (TTM) models generate music corresponding to text descriptions. Typically UNet based diffusion models condition on text embeddings generated from a pr…
eess.AS2025
persoDA: Personalized Data Augmentation for Personalized ASR
Pablo Peso Parada, Spyros Fontalis, Md Asif Jalal +6
Data augmentation (DA) is ubiquitously used in training of Automatic Speech Recognition (ASR) models. DA offers increased data variability, robustness and generalization against di…