2 papers
cs.LG2026
LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents
Hyesung Jeon, Hyeongju Ha, Jae-Joon Kim
Role specialization in multi-LLM agent systems is often realized via multi-LoRA, where agents share a pretrained backbone and differ only by lightweight adapters. Despite sharing b…
cs.CL2026
RelayGen: Intra-Generation Model Switching for Efficient Reasoning
Jiwon Song, Yoongon Kim, Jae-Joon Kim
Large reasoning models (LRMs) achieve strong performance on complex reasoning tasks by generating long, multi-step reasoning trajectories, but inference-time scaling incurs substan…