5 papers
Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS
Kirill Borodin, Vasiliy Kudryavtsev, Maxim Maslov +3
We investigate multi-stage pretraining for prosody modeling in diffusion-based TTS. A speaker-conditioned dual-stream encoder is trained with masked language modeling followed by S…
When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus
Kirill Borodin, Vasiliy Kudryavtsev, Maxim Maslov +2
We introduce LRLspoof, a large-scale multilingual synthetic-speech corpus for cross-lingual spoof detection, comprising 2,732 hours of audio generated with 24 open-source TTS syste…
Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
Kirill Borodin, Nikita Vasiliev, Vasiliy Kudryavtsev +3
We introduce Balalaika, an open-source, data-centric pipeline for processing audio and producing prosody-aware annotations. It combines semantic VAD for context-preserving segmenta…
AASIST3: KAN-Enhanced AASIST Speech Deepfake Detection using SSL Features and Additional Regularization for the ASVspoof 2024 Challenge
Kirill Borodin, Vasiliy Kudryavtsev, Dmitrii Korzh +4
Automatic Speaker Verification (ASV) systems, which identify speakers based on their voice characteristics, have numerous applications, such as user authentication in financial tra…
An information security monitoring and management system for 5G and 6G Networks based on SDN/NFV
Igor Buzhin, Veronica Antonova, Yury Mironov +3
An approach to using the concept of Software-Defined Networking and Network Functions Virtualization (SDN/NFV) for the implementation of an information security monitoring and mana…