1 paper
Yusuf Kalayci, Vinod Raman, Shaddin Dughmi
Large language model (LLM) generation often requires balancing output quality against inference cost, especially when using multiple generations. We introduce a new framework for i…