Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Outlier Smoothing with Closed-Form Rotations for W4A4 Large Language Model Quantization
Jinying Xiao, Bin Ji, Shasha Li +8
Large Language Models (LLMs) quantization facilitates deploying LLMs in resource-limited settings, but existing methods that combine incompatible gradient optimization and quantiza…
cs.LG2025
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
Yuhao Zhou, Sirui Song, Boyang Liu +6
Rotary Position Embedding (RoPE) enables each attention head to capture multi-frequency information along the sequence dimension and is widely applied in foundation models. However…