2 papers
cs.LG2026
GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation
Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann +1
Autoregressive decoding with LLMs is primarily bottlenecked by GPU memory bandwidth, especially in edge-computing settings. While quantization is essential for mitigating this bott…
cs.NE2026
SiLIF: Structured State Space Model Dynamics and Parametrization for Spiking Neural Networks
Maxime Fabre, Lyubov Dudchenko, Younes Bouhadjar +1
Multi-state spiking neurons combine sparse binary activations with rich second-order nonlinear recurrent dynamics, making them a promising alternative to standard deep learning mod…