1 paper · 1 filter
Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha +1
The growing deployment of large language models (LLMs) makes per-request routing essential for balancing response quality and computational cost across heterogeneous model pools. C…