2 papers
cs.CV2026
TMPDiff: Temporal Mixed-Precision for Diffusion Models
Basile Lewandowski, Simon Kurz, Aditya Shankar +3
Diffusion models are the go-to method for Text-to-Image generation, but their iterative denoising processes has high inference latency. Quantization reduces compute time by using l…
cs.CL2025
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
Simon Kurz, Jian-Jia Chen, Lucie Flek +1
Recent advances in large language model (LLM) pruning have shown state-of-the-art (SotA) compression results in post-training and retraining-free settings while maintaining high pr…