3 papers
cs.CL2026
Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders
Yexing Du, Kaiyuan Liu, Youcheng Pan +4
Multimodal large language models (MLLMs) have achieved significant success in speech-to-text translation (S2TT). However, when processing multilingual speech inputs, a single speec…
cs.CL2025
Enhancing Non-English Capabilities of English-Centric Large Language Models through Deep Supervision Fine-Tuning
Wenshuai Huo, Xiaocheng Feng, Yichong Huang +9
Large language models (LLMs) have demonstrated significant progress in multilingual language understanding and generation. However, due to the imbalance in training data, their cap…
cs.CL2024
Ensuring Consistency for In-Image Translation
Chengpeng Fu, Xiaocheng Feng, Yichong Huang +9
The in-image machine translation task involves translating text embedded within images, with the translated results presented in image format. While this task has numerous applicat…