1 paper
Zicong Ye, Kunming Zhang, Guoming Tang
The explosive growth of interactive Large Language Models (LLMs) has placed unprecedented demands for low latency on cloud GPUs, forcing them into high-power modes and causing esca…