2 papers
cs.CL2025
Granary: Speech Recognition and Translation Dataset in 25 European Languages
Nithin Rao Koluguri, Monica Sekoyan, George Zelenfroynd +12
Multi-task and multilingual approaches benefit large models, yet speech processing for low-resource languages remains underexplored due to data scarcity. To address this, we presen…
cs.SD2025
Methods to Increase the Amount of Data for Speech Recognition for Low Resource Languages
Alexan Ayrapetyan, Sofia Kostandian, Ara Yeroyan +5
This study explores methods to increase data volume for low-resource languages using techniques such as crowdsourcing, pseudo-labeling, advanced data preprocessing and various perm…