1 paper · 1 filter
Danil Sivtsov, Aleksandr Katrutsa, Ivan Oseledets
Efficient deployment of a pre-trained LLM to a cluster with multiple servers is a critical step for providing fast responses to users' queries. The recent success of Mixture-of-Exp…