1 paper
Shuhan Wang, Yilin Luo, Nan Xu +1
Rotation-based post-training quantisation commonly applies an orthogonal transform across an entire attention head to reduce outlier-induced error. RoPE instead partitions each hea…