2 papers
cs.LG2025
DiSCo: Device-Server Collaborative LLM-Based Text Streaming Services
Ting Sun, Penghan Wang, Fan Lai
The rapid rise of large language models (LLMs) in text streaming services has introduced significant cost and Quality of Experience (QoE) challenges in serving millions of daily re…
cs.IR2024
Fine-Grained Embedding Dimension Optimization During Training for Recommender Systems
Qinyi Luo, Penghan Wang, Wei Zhang +8
Huge embedding tables in modern deep learning recommender models (DLRM) require prohibitively large memory during training and inference. This paper proposes FIITED, a system to au…