1 paper
Zhuang Zhuang, Zhipeng Wei, Ji Dai +4
Linear attention provides an efficient backbone for long-sequence recommendation by avoiding the quadratic cost of standard Transformers, but its compressed recurrent state can be…