7 papers
SpeechLLM Meets Federated Learning for End-to-End ASR: English and Italian Case Studies
Mohamed Nabih Ali, Daniele Falavigna, Alessio Brutti
Federated learning (FL) enables privacy-preserving training of automatic speech recognition (ASR) systems across distributed data sources, yet its application to large-scale speech…
Distillation-based Layer Dropping (DLD): Effective End-to-end Framework for Dynamic Speech Networks
Abdul Hannan, Daniele Falavigna, Shah Nawaz +3
Edge devices operate in constrained and varying resource settings, requiring dynamic architectures that can adapt to limitations of the available resources. To meet such demands, l…
MLMA: Towards Multilingual ASR With Mamba-based Architectures
Mohamed Nabih Ali, Daniele Falavigna, Alessio Brutti
Multilingual automatic speech recognition (ASR) remains a challenging task, especially when balancing performance across high- and low-resource languages. Recent advances in sequen…
Input Conditioned Layer Dropping in Speech Foundation Models
Abdul Hannan, Daniele Falavigna, Alessio Brutti
Curating foundation speech models for edge and IoT settings, where computational resources vary over time, requires dynamic architectures featuring adaptable reduction strategies.…
Splitformer: An improved early-exit architecture for automatic speech recognition on edge devices
Maxence Lasbordes, Daniele Falavigna, Alessio Brutti
The ability to dynamically adjust the computational load of neural models during inference in a resource aware manner is crucial for on-device processing scenarios, characterised b…
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach
Umberto Cappellazzo, Minsu Kim, Stavros Petridis +2
Audio-Visual Speech Recognition (AVSR) enhances robustness in noisy environments by integrating visual cues. While recent advances integrate Large Language Models (LLMs) into AVSR,…