2 papers
cs.CR2026
PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems
Panagiotis Georgios Pennas, Konstantinos Papaioannou, Marco Guarnieri +1
Large Language Models (LLMs) rely on optimizations like Automatic Prefix Caching (APC) to accelerate inference. APC works by reusing previously computed states for the beginning pa…
cs.DC2026
TCM-Serve: Modality-aware Scheduling for Multimodal Large Language Model Inference
Konstantinos Papaioannou, Thaleia Dimitra Doudali
Multimodal Large Language Models (MLLMs) power platforms like ChatGPT, Gemini, and Copilot, enabling richer interactions with text, images, and videos. These heterogeneous workload…