1 paper
Xinyu Wang, Jieyu Li, Yanan Sun +1
Large Language Models (LLMs) incur substantial memory and computation costs. Prior works reduce FP-INT arithmetic overhead by converting linear-layer activations to block floating…