3 papers
cs.CL2026
English to Central Kurdish Speech Translation: Corpus Creation, Evaluation, and Orthographic Standardization
Mohammad Mohammadamini, Daban Q. Jaff, Josep Crego +2
We present KUTED, a speech-to-text translation (S2TT) dataset for Central Kurdish, derived from TED and TEDx talks. The corpus comprises 91,000 sentence pairs, including 170 hours…
cs.CL2025
Improving Retrieval-Augmented Neural Machine Translation with Monolingual Data
Maxime Bouthors, Josep Crego, François Yvon
Conventional retrieval-augmented neural machine translation (RANMT) systems leverage bilingual corpora, e.g., translation memories (TMs). Yet, in many settings, monolingual corpora…
cs.CL2024
Optimizing example selection for retrieval-augmented machine translation with translation memories
Maxime Bouthors, Josep Crego, François Yvon
Retrieval-augmented machine translation leverages examples from a translation memory by retrieving similar instances. These examples are used to condition the predictions of a neur…