1 paper · 1 filter
Aditya Desai, Kumar Krishna Agrawal, Shuo Yang +5
State-of-the-art sparse attention methods for reducing decoding latency fall into two main categories: approximate top-k (and its extension, top-p) and recently introduced samp…