1 paper
Dejan Äugalj, Aleksandar Jevremovic
Modern Large Language Models (LLMs) rely on Transformer self-attention, which scales quadratically with sequence length. Recent linear-time alternatives, like State Space Models (S…