2 papers
cs.LG2026
REAL-Q: E2E LLM Quantization via Dynamic Gradient Descent
Qian Zhang, Yaoming Li, Zhewen Tan +9
Post-training quantization (PTQ) is essential for deploying large language models (LLMs) under strict resource constraints. State-of-the-art PTQ methods quantize each layer with a…
cs.AI2026
ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization
Yongge Ma, Guoan Wang, Feiyu Wang +5
Post-training quantization (PTQ) is widely used to reduce the memory and computational cost of large language models. Existing PTQ methods typically obtain an initial quantized mod…