3 papers
cs.NE2026
Adaptive Speech-to-Spike Encoding for Spiking Neural Networks
Taharim Rahman Anon, Jakaria Islam Emon
The mismatch between continuous acoustic signals and discrete event-driven processing remains a fundamental bottleneck for neuromorphic speech processing. Current systems typically…
cs.SD2025
WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction
Jakaria Islam Emon, Kazi Tamanna Alam, Md. Abu Salek
Mean Opinion Score (MOS) prediction for text to music systems requires evaluating both overall musical quality and text prompt alignment. This paper introduces WhisQ, a multimodal…
cs.SD2025
Whisper Speaker Identification: Leveraging Pre-Trained Multilingual Transformers for Robust Speaker Embeddings
Jakaria Islam Emon, Md Abu Salek, Kazi Tamanna Alam
Speaker identification in multilingual settings presents unique challenges, particularly when conventional models are predominantly trained on English data. In this paper, we propo…