2 papers
cs.CV2026
Amortized-Precision Quantization for Early-Exit Vision Transformers
Rui Fang, Hsi-Wen Chen, Ming-Syan Chen
Vision Transformers (ViTs) achieve strong performance across vision tasks, yet their deployment with low-precision early exiting remains fragile. Existing quantization methods assu…
cs.LG2026
KV Admission: Learning What to Write for Efficient Long-Context Inference
Yen-Chieh Huang, Pi-Cheng Hsiu, Rui Fang +1
Long-context LLM inference is bottlenecked by the quadratic attention complexity and linear KV cache growth. Prior approaches mitigate this via post-hoc selection or eviction but o…