2 papers
q-bio.GN2025
DNAMotifTokenizer: Towards Biologically Informed Tokenization of Genomic Sequences
Xiaoxiao Zhou, Zihan Wang, Jingbo Shang +1
DNA language models have advanced genomics, but their downstream performance varies widely due to differences in tokenization, pretraining data, and architecture. We argue that a m…
cs.LG2024
CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X
Qinkai Zheng, Xiao Xia, Xu Zou +10
Large pre-trained code generation models, such as OpenAI Codex, can generate syntax- and function-correct code, making the coding of programmers more productive and our pursuit of…