2 papers
cs.CL2025
How Important is `Perfect' English for Machine Translation Prompts?
PatrÃcia Schmidtová, Niyati Bafna, Seth Aycock +4
Large language models (LLMs) have achieved top results in recent machine translation evaluations, but they are also known to be sensitive to errors and perturbations in their promp…
cs.CL2025
Conditional Unigram Tokenization with Parallel Data
Gianluca Vico, JindÅinch Libovický
We introduce conditional unigram tokenization, a novel approach that extends unigram tokenization by conditioning target token probabilities on source-language tokens from parallel…