1 paper · 1 filter
Neelesh Gupta, Rakshith Jayanth, Dhruv Parikh +1
The proliferation of large language models has driven demand for long-context inference on resource-constrained edge platforms. However, deploying these models on Neural Processing…