1 paper
Cheung Hao Lee, Patrick Wong
A multi-model language service must route each request while preserving workload-level budgets for compute, latency, memory, or monetary cost. Two features make this problem materi…