1 paper · 1 filter
Yinxi Li, Yuntian Deng, Pengyu Nie
Large language models (LLMs) for code rely on subword tokenizers, such as byte-pair encoding (BPE), learned from mixed natural language text and programming language code but drive…