4 papers
KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving
Zedong Liu, Xinyang Ma, Dejun Luo +9
LLMs are widely adopted in production, pushing inference systems to their limits. Disaggregated LLM serving (e.g., PD separation and KV state disaggregation) improves scalability a…
AgentSlimming: Towards Efficient and Cost-Aware Multi-Agent Systems
Yulang Chen, Haoxuan Peng, Jinyan Liu +3
Large Language Model-based Multi-Agent Systems (MAS) have demonstrated remarkable capabilities in complex tasks. However, manually designing optimal communication topologies is lab…
GPZ: GPU-Accelerated Lossy Compressor for Particle Data
Ruoyu Li, Yafan Huang, Longtao Zhang +10
Particle-based simulations and point-cloud applications generate massive, irregular datasets that challenge storage, I/O, and real-time analytics. Traditional compression technique…
NeurLZ: An Online Neural Learning-Based Method to Enhance Scientific Lossy Compression
Wenqi Jia, Zhewen Hu, Youyuan Liu +10
Large-scale scientific simulations generate massive datasets, posing challenges for storage and I/O. Traditional lossy compression struggles to advance more in balancing compressio…