1 paper · 1 filter
Jiahuan Yu, Aryan Taneja, Junfeng Lin +1
The energy cost of Large Language Model (LLM) inference is rapidly becoming a barrier to sustainable and scalable deployment. Although modern serving architectures expose distinct…