27 citations · 33 across the 2 of their papers we have counts for
2 papers
cs.DC2020★ 6 cited
Optimizing Prediction Serving on Low-Latency Serverless Dataflow
Vikram Sreekanti, Harikaran Subbaraj, Chenggang Wu +2
Prediction serving systems are designed to provide large volumes of low-latency inferences machine learning models. These systems mix data processing and computationally intensive…
cs.DC2018★ 27 cited
Dynamic Space-Time Scheduling for GPU Inference
Paras Jain, Xiangxi Mo, Ajay Jain +5
Serving deep neural networks in latency critical interactive settings often requires GPU acceleration. However, the small batch sizes typical in online inference results in poor GP…