1 paper
Yu Luo, Bo Dong, Wenhua Cheng +1
Serving large language models (LLMs) under diverse deployment constraints requires flexible trade-offs between accuracy, memory footprint, and throughput. However, conventional qua…