4 papers
DeLS-Spec: Decoupled Long-Short Contexts for Parallel Speculative Drafting
Hong-Kai Zheng, Piji Li
Speculative decoding accelerates LLM inference by drafting multiple tokens and verifying them in parallel. Block-parallel drafters such as DFlash further improve drafting efficienc…
Temporal Guidance for Large Language Models
Hong-Kai Zheng, Piji Li
Contrastive Decoding (CD) enhances the generation quality of large language models (LLMs) but incurs significant additional computational overhead due to the need for an auxiliary…
LSRS: Latent Scale Rejection Sampling for Visual Autoregressive Modeling
Hong-Kai Zheng, Piji Li
Visual Autoregressive (VAR) modeling approach for image generation proposes autoregressive processing across hierarchical scales, decoding multiple tokens per scale in parallel. Th…
Group-Wise Optimization for Self-Extensible Codebooks in Vector Quantized Models
Hong-Kai Zheng, Piji Li
Vector Quantized Variational Autoencoders (VQ-VAEs) leverage self-supervised learning through reconstruction tasks to represent continuous vectors using the closest vectors in a co…