2 papers
cs.CL2026
Mixture of Experts for Low-Resource LLMs
Ori Bar Joseph, Smadar Arvatz, Noam Kayzer +2
Mixture-of-Experts (MoE) architectures enable efficient model scaling, yet expert routing behavior across underrepresented languages remains poorly understood. We analyze routing d…
cs.CL2026
HEBATRON: A Hebrew-Specialized Open-Weight Mixture-of-Experts Language Model
Noam Kayzer, Dan Revital, Ori Bar Joseph +10
We present Hebatron, a Hebrew-specialized open-weight large language model built on the NVIDIA Nemotron-3 sparse Mixture-of-Experts architecture. Training employs a three-phase eas…