1 paper
Yi-Chien Lin, Woosuk Kwon, Ronald Pineda +1
Efficiently serving Large Language Models (LLMs) requires selecting an optimal parallel execution plan, balancing computation, memory, and communication overhead. However, determin…