1 paper · 1 filter
Bradley McDanel, Steven Li, Harshit Khaitan
The prefill stage in long-context LLM inference remains a computational bottleneck. Recent token-ranking heuristics accelerate inference by selectively processing a subset of seman…