1 paper
Junming Zhang, Qinyan Zhang, Huajun Sun +4
Edge acceleration for large language models is crucial for their widespread application; however, achieving fast attention inference and efficient decoding on resource-constrained…