2 papers
cs.AR2025
CHIME: A Case for Efficient Long-Context Attention-FC Disaggregated Inference with DIMM-PIM
Qingyuan Liu, Liyan Chen, Yanning Yang +6
Attention-FC Disaggregated (AFD) LLM inference systems offload memory-bound Attention operations to memory-rich accelerators (e.g., CPUs, HBM-PIM) while retaining compute-bound Ful…
cs.DC2024
Jiagu: Optimizing Serverless Computing Resource Utilization with Harmonized Efficiency and Practicability
Qingyuan Liu, Yanning Yang, Dong Du +5
Current serverless platforms struggle to optimize resource utilization due to their dynamic and fine-grained nature. Conventional techniques like overcommitment and autoscaling fal…