2 papers
cs.CL2025
Saliency-driven Dynamic Token Pruning for Large Language Models
Yao Tao, Yehui Tang, Yun Wang +3
Despite the recent success of large language models (LLMs), LLMs are particularly challenging in long-sequence inference scenarios due to the quadratic computational complexity of…
cs.CL2024
Neural Search Space in Gboard Decoder
Yanxiang Zhang, Yuanbo Zhang, Haicheng Sun +4
Gboard Decoder produces suggestions by looking for paths that best match input touch points on the context aware search space, which is backed by the language Finite State Transduc…