1 paper · 1 filter
Mark Kashirskiy, Artiom Lipinski, Ilya Makarov
Tokenization is a critical preprocessing step for large language models (LLMs), directly impacting training efficiency and downstream performance. General-purpose tokenizers traine…