2 papers
cs.AR2025
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
Tatsuya Kubo, Daichi Tokuda, Tomoya Nagatani +4
General matrix-vector multiplication (GeMV) remains a critical latency bottleneck in large language model (LLM) inference, even with quantized low-bit models. Processing-Using-DRAM…
cs.LG2025
PRIOT: Pruning-Based Integer-Only Transfer Learning for Embedded Systems
Honoka Anada, Sefutsu Ryu, Masayuki Usui +2
On-device transfer learning is crucial for adapting a common backbone model to the unique environment of each edge device. Tiny microcontrollers, such as the Raspberry Pi Pico, are…