2 papers
cs.CL2026
TF-Engram: A Train-Free Engram with SSD-Backed Memory for Large Language Models
Yutang Ma, Kecheng Huang, Xikun Jiang +1
Large Language Models (LLMs) store factual knowledge and domain-specific patterns implicitly in dense Transformer parameters, making knowledge expansion costly through pretraining,…
cs.DC2025
Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity
Wenbin Zhu, Zhaoyan Shen, Zili Shao +2
Serverless Large Language Models (LLMs) have emerged as a cost-effective solution for deploying AI services by enabling a 'pay-as-you-go' pricing model through GPU resource sharing…