1.4k citations
- Centre National de la Recherche ScientifiqueFR23 papers
- Aalto UniversityFI20 papers
- University of PotsdamDE16 papers
- Charles UniversityCZ13 papers
- University of HelsinkiFI11 papers
- Franche-Comté Électronique Mécanique Thermique et Optique - Sciences et TechnologiesFR10 papers
- European Southern ObservatoryCL9 papers
- Observatoire de la Côte d’AzurFR9 papers
- Search for Extraterrestrial IntelligenceUS9 papers
- Adam Mickiewicz University in PoznańPL8 papers
- Helsinki Institute of PhysicsFI8 papers
- Institut de Mécanique Céleste et de Calcul des ÉphéméridesFR8 papers
9 papers · 1 filter
Enriched Music Representations with Multiple Cross-modal Contrastive Learning
Andres Ferraro, Xavier Favory, Konstantinos Drossos +2
Modeling various aspects that make a music piece unique is a challenging task, requiring the combination of multiple sources of information. Deep learning is commonly used to obtai…
Towards Citizen Science for Smart Cities: A Framework for a Collaborative Game of Bird Call Recognition Based on Internet of Sound Practices
Emmanuel Rovithis, Nikolaos Moustakas, Konstantinos Vogklis +2
Citizen Science aims to engage people in research activities on important issues related to their well-being. Smart Cities aim to provide them with services that improve the qualit…
Speech Command Recognition in Computationally Constrained Environments with a Quadratic Self-organized Operational Layer
Mohammad Soltanian, Junaid Malik, Jenni Raitoharju +3
Automatic classification of speech commands has revolutionized human computer interactions in robotic applications. However, employed recognition models usually follow the methodol…
Multi-task Regularization Based on Infrequent Classes for Audio Captioning
Emre Çakır, Konstantinos Drossos, Tuomas Virtanen
Audio captioning is a multi-modal task, focusing on using natural language for describing the contents of general audio. Most audio captioning methods are based on deep neural netw…
VOICe: A Sound Event Detection Dataset For Generalizable Domain Adaptation
Shayan Gharib, Konstantinos Drossos, Eemi Fagerlund +1
The performance of sound event detection methods can significantly degrade when they are used in unseen conditions (e.g. recording devices, ambient noise). Domain adaptation is a p…
Deep Learning for Audio Signal Processing
Hendrik Purwins, Bo Li, Tuomas Virtanen +3
Given the recent surge in developments of deep learning, this article provides a review of the state-of-the-art deep learning techniques for audio signal processing. Speech, music,…