5 citations · 5 across the 2 of their papers we have counts for
1 paper · 1 filter
Hanzhi Zhang, Qiao Zhang, Qinglei Cao +4
Long-context prefill in large language models (LLMs) incurs substantial computation and memory traffic because dense self-attention computes quadratic query-key scores. Existing me…