1 paper
Jiaju Chen, Chongming Gao, Chenxiao Fan +4
Large language model (LLM)-based generative list-wise recommendation has advanced rapidly, but decoding remains sequential and thus latency-prone. To accelerate inference without c…