1 paper
Jungsuk Oh, Hyeseo Jeon, Hyunjune Ji +2
Long-context inference in decoder-only language models is costly because long prompts are processed during Prefill, cached at every layer, and repeatedly attended to during autoreg…