NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (50)

cs.CL2024

Transducer-Llama: Integrating LLMs into Streamable Transducer-based Speech Recognition

Keqi Deng, Jinxi Guo, Yingyi Ma +4

cs.CL2022

Biased Self-supervised learning for ASR

Florian L. Kreyssig, Yangyang Shi, Jinxi Guo +3

cs.LG2021

A Distributed Optimisation Framework Combining Natural Gradient with Hessian-Free for Discriminative Sequence Training

Adnan Haider, Chao Zhang, Florian L. Kreyssig +1

eess.AS2024

Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning

Keqi Deng, Guangzhi Sun, Philip C. Woodland

eess.AS2019

Integrating Source-channel and Attention-based Sequence-to-sequence Models for Speech Recognition

Qiujia Li, Chao Zhang, Philip C. Woodland

cs.CL2023

Self-supervised representations in speech-based depression detection

Wen Wu, Chao Zhang, Philip C. Woodland

cs.CL2023

End-to-end Spoken Language Understanding with Tree-constrained Pointer Generator

Guangzhi Sun, Chao Zhang, Philip C. Woodland

eess.AS2020

Discriminative Neural Clustering for Speaker Diarisation

Qiujia Li, Florian L. Kreyssig, Chao Zhang +1

eess.AS2024

SOT Triggered Neural Clustering for Speaker Attributed ASR

Xianrui Zheng, Guangzhi Sun, Chao Zhang +1

eess.AS2023

FastInject: Injecting Unpaired Text Data into CTC-based ASR training

Keqi Deng, Philip C. Woodland

cs.CL2022

Distribution-based Emotion Recognition in Conversation

Wen Wu, Chao Zhang, Philip C. Woodland

cs.CL2018

Sequence Training of DNN Acoustic Models With Natural Gradient

Adnan Haider, Philip C. Woodland

cs.CL2022

Estimating the Uncertainty in Emotion Class Labels with Utterance-Specific Dirichlet Priors

Wen Wu, Chao Zhang, Xixin Wu +1

eess.AS2020

Improved Large-margin Softmax Loss for Speaker Diarisation

Yassir Fathullah, Chao Zhang, Philip C. Woodland

cs.CL2026

Cross-Lingual Interleaving for Speech Language Models

Adel Moumen, Guangzhi Sun, Philip C. Woodland

cs.CL2023

Knowledge-Aware Audio-Grounded Generative Slot Filling for Limited Annotated Data

Guangzhi Sun, Chao Zhang, Ivan Vulić +2

cs.CL2023

Speech-based Slot Filling using Large Language Models

Guangzhi Sun, Shutong Feng, Dongcheng Jiang +3

eess.AS2025

DNCASR: End-to-End Training for Speaker-Attributed ASR

Xianrui Zheng, Chao Zhang, Philip C. Woodland

eess.AS2023

Decoupled Structure for Improved Adaptability of End-to-End Models

Keqi Deng, Philip C. Woodland

eess.AS2022

Tandem Multitask Training of Speaker Diarisation and Speech Recognition for Meeting Transcription

Xianrui Zheng, Chao Zhang, Philip C. Woodland

eess.AS2023

Label-Synchronous Neural Transducer for End-to-End ASR

Keqi Deng, Philip C. Woodland

eess.AS2023

Adaptable End-to-End ASR Models using Replaceable Internal LMs and Residual Softmax

Keqi Deng, Philip C. Woodland

cs.CL2021

Emotion recognition by fusing time synchronous and time asynchronous representations

Wen Wu, Chao Zhang, Philip C. Woodland

cs.CL2024

Confidence Estimation for Automatic Detection of Depression and Alzheimer's Disease Based on Clinical Interviews

Wen Wu, Chao Zhang, Philip C. Woodland

cs.CL2023

Can Contextual Biasing Remain Effective with Whisper and GPT-2?

Guangzhi Sun, Xianrui Zheng, Chao Zhang +1

eess.AS2022

Knowledge Distillation for Neural Transducers from Large Self-Supervised Pre-trained Models

Xiaoyu Yang, Qiujia Li, Philip C. Woodland

cs.CL2025

SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation

Keqi Deng, Wenxi Chen, Xie Chen +1

eess.AS2024

1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem

Mingjie Chen, Hezhao Zhang, Yuanchao Li +11

eess.AS2023

Knowledge Distillation from Multiple Foundation Models for End-to-End Speech Recognition

Xiaoyu Yang, Qiujia Li, Chao Zhang +1

eess.AS2026

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

Mohan Li, Rama Doddipatla, Philip C. Woodland

cs.CL2021

Tree-constrained Pointer Generator for End-to-end Contextual Speech Recognition

Guangzhi Sun, Chao Zhang, Philip C. Woodland

cs.LG2025

Multi-head Temporal Latent Attention

Keqi Deng, Philip C. Woodland

eess.AS2023

Self-Supervised Learning-Based Source Separation for Meeting Data

Yuang Li, Xianrui Zheng, Philip C. Woodland

cs.SD2023

Estimating the Uncertainty in Emotion Attributes using Deep Evidential Regression

Wen Wu, Chao Zhang, Philip C. Woodland

eess.AS2023

Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition

Keqi Deng, Philip C. Woodland

cs.CL2024

Label-Synchronous Neural Transducer for E2E Simultaneous Speech Translation

Keqi Deng, Philip C. Woodland

eess.AS2020

Confidence Estimation for Attention-based Sequence-to-sequence Models for Speech Recognition

Qiujia Li, David Qiu, Yu Zhang +5

eess.AS2021

Combining Frame-Synchronous and Label-Synchronous Systems for Speech Recognition

Qiujia Li, Chao Zhang, Philip C. Woodland

cs.SD2022

Tree-constrained Pointer Generator with Graph Neural Network Encodings for Contextual Speech Recognition

Guangzhi Sun, Chao Zhang, Philip C. Woodland

eess.AS2023

Integrating Emotion Recognition with Speech Recognition and Speaker Diarisation for Conversations

Wen Wu, Chao Zhang, Philip C. Woodland

cs.SD2023

Spectral Clustering-aware Learning of Embeddings for Speaker Diarisation

Evonne P. C. Lee, Guangzhi Sun, Chao Zhang +1

eess.AS2026

Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing

Mengqi Wang, Zhan Liu, Zengrui Jin +3

cs.CL2024

Handling Ambiguity in Emotion: From Out-of-Domain Detection to Distribution Estimation

Wen Wu, Bo Li, Chao Zhang +5

cs.CL2026

CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

Guangzhi Sun, Xiao Zhan, Shutong Feng +2

eess.AS2024

Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation

Nineli Lashkarashvili, Wen Wu, Guangzhi Sun +1

cs.CL2021

Adapting GPT, GPT-2 and BERT Language Models for Speech Recognition

Xianrui Zheng, Chao Zhang, Philip C. Woodland

eess.AS2021

Residual Energy-Based Models for End-to-End Speech Recognition

Qiujia Li, Yu Zhang, Bo Li +2

eess.AS2022

Improving Confidence Estimation on Out-of-Domain Data for End-to-End Speech Recognition

Qiujia Li, Yu Zhang, David Qiu +3

cs.CL2023

It HAS to be Subjective: Human Annotator Simulation via Zero-shot Density Estimation

Wen Wu, Wenlin Chen, Chao Zhang +1

eess.AS2020

Cosine-Distance Virtual Adversarial Training for Semi-Supervised Speaker-Discriminative Acoustic Embeddings

Florian L. Kreyssig, Philip C. Woodland