1 paper
Hui Guo, Qihang Zheng, Chenghai Huo +3
The efficient deployment of large language models (LLMs) is hindered by memory architecture heterogeneity, where traditional compilers suffer from fragmented workflows and high ada…