3 papers
cs.DC2026
HuntMS: A Framework for Microservice Geo-Distribution for Carbon and Cost Reduction
Georgia Christofidi, Francisco Ãlvarez-Terribas, Ioannis Roumpos +3
Microservices are a dominant architecture in cloud computing, offering scalability and modularity, but also posing complex deployment challenges. As data centers contribute signifi…
cs.CR2026
PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems
Panagiotis Georgios Pennas, Konstantinos Papaioannou, Marco Guarnieri +1
Large Language Models (LLMs) rely on optimizations like Automatic Prefix Caching (APC) to accelerate inference. APC works by reusing previously computed states for the beginning pa…
cs.DC2026
TCM-Serve: Modality-aware Scheduling for Multimodal Large Language Model Inference
Konstantinos Papaioannou, Thaleia Dimitra Doudali
Multimodal Large Language Models (MLLMs) power platforms like ChatGPT, Gemini, and Copilot, enabling richer interactions with text, images, and videos. These heterogeneous workload…