2 papers
cs.LG2025
Assembly of Experts: Linear-time construction of the Chimera LLM variants with emergent and adaptable behaviors
Henrik Klagges, Robert Dahlke, Fabian Klemm +4
Requiring - FLOPs to calculate one 8 bit weight in an LLM during pretraining is extremely expensive and seems inefficient. To better leverage the huge investments…
cs.AI2025
Mixture of Tunable Experts -- Behavior Modification of DeepSeek-R1 at Inference Time
Robert Dahlke, Henrik Klagges, Dan Zecha +3
We present the Mixture-of-Tunable-Experts (MoTE), a method that extends the Mixture-of-Experts architecture of Large Language Models (LLMs). Without additional training, MoTE enabl…