1 paper · 1 filter
Daehyeon Baek, Jieun Choi, Jimyoung Son +5
As large language models become increasingly prevalent, memory bandwidth constraints significantly limit inference throughput, motivating post-training quantization (PTQ). In this…