1 paper · 1 filter
Amir Taherin, Sana Taghipour Anvari, Charles Amante +9
Edge LLM deployment is shaped by more than model size and precision: inference backend, hardware platform, memory traffic, and power management all affect latency and efficiency. W…