1 paper · 1 filter
Zimo Zhao, Maolin Wang, Bowen Yu +3
Post-training quantization (PTQ) is essential for efficient large language model inference, but reliably quantizing activations remains challenging when weights, activations, and K…