Publications (23)
Improved Neural Language Model Fusion for Streaming Recurrent Neural Network Transducer
Suyoun Kim, Yuan Shangguan, Jay Mahadeokar +4
Environmental Noise Embeddings for Robust Speech Recognition
Suyoun Kim, Bhiksha Raj, Ian Lane
Evaluating User Perception of Speech Recognition System Quality with Semantic Distance Metric
Suyoun Kim, Duc Le, Weiyi Zheng +6
Contextualized Streaming End-to-End Speech Recognition with Trie-Based Deep Biasing and Shallow Fusion
Duc Le, Mahaveer Jain, Gil Keren +9
Multimodal Transfer Deep Learning with Applications in Audio-Visual Recognition
Seungwhan Moon, Suyoun Kim, Haohan Wang
Augmenting text for spoken language understanding with Large Language Models
Roshan Sharma, Suyoun Kim, Daniel Lazar +7
Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models
Chun-Yi Kuan, Siwon Kim, Byeonggeun Kim +8
The paper proposes using audio-aware large language models to give fine‑grained feedback on text‑to‑audio generation, improving how well the generated audio follows multi‑event and…
Dialog-context aware end-to-end speech recognition
Suyoun Kim, Florian Metze
Joint CTC-Attention based End-to-End Speech Recognition using Multi-task Learning
Suyoun Kim, Takaaki Hori, Shinji Watanabe
Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding
Suyoun Kim, Abhinav Arora, Duc Le +4
Acoustic-to-Word Models with Conversational Context Information
Suyoun Kim, Florian Metze
Modality Confidence Aware Training for Robust End-to-End Spoken Language Understanding
Suyoun Kim, Akshat Shrivastava, Duc Le +3
Deliberation Model for On-Device Spoken Language Understanding
Duc Le, Akshat Shrivastava, Paden Tomasello +4
Improving RNN Transducer Based ASR with Auxiliary Tasks
Chunxi Liu, Frank Zhang, Duc Le +3
Improved training for online end-to-end speech recognition systems
Suyoun Kim, Michael L. Seltzer, Jinyu Li +1
Recurrent Models for Auditory Attention in Multi-Microphone Distance Speech Recognition
Suyoun Kim, Ian Lane
Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion
Suyoun Kim, Siddharth Dalmia, Florian Metze
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
Trang Le, Daniel Lazar, Suyoun Kim +6
Introducing Semantics into Speech Encoders
Derek Xu, Shuyan Dong, Changhan Wang +10
Towards Language-Universal End-to-End Speech Recognition
Suyoun Kim, Michael L. Seltzer
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
Wonjune Kang, Junteng Jia, Chunyang Wu +8
Cross-Attention End-to-End ASR for Two-Party Conversations
Suyoun Kim, Siddharth Dalmia, Florian Metze
Joint Audio/Text Training for Transformer Rescorer of Streaming Speech Recognition
Suyoun Kim, Ke Li, Lucas Kabela +4