1 paper
Ekaterina Alimaskina, Darya Rudas, Denis Shveykin +3
Large Reasoning Models (LRMs) rely on long reasoning traces, making inference expensive. While low-bit quantization reduces per-token decoding cost, we show that aggressive 2-bit i…