2 papers
cs.AR2025
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
Tatsuya Kubo, Daichi Tokuda, Tomoya Nagatani +4
General matrix-vector multiplication (GeMV) remains a critical latency bottleneck in large language model (LLM) inference, even with quantized low-bit models. Processing-Using-DRAM…
cs.AR2025
PUDTune: Multi-Level Charging for High-Precision Calibration in Processing-Using-DRAM
Tatsuya Kubo, Daichi Tokuda, Lei Qu +2
Recently, practical analog in-memory computing has been realized using unmodified commercial DRAM modules. The underlying Processing-Using-DRAM (PUD) techniques enable high-through…