1 paper · 1 filter
Shuhan Wang, Yilin Luo, Nan Xu +1
Rotation-based post-training quantisation commonly applies an orthogonal transform across an entire attention head to reduce outlier-induced error. RoPE instead partitions each hea…