2 papers
cs.LG2026
P-EAGLE: Parallel-Drafting EAGLE with Scalable Training
Mude Hui, Xin Huang, Jaime Campos Salas +5
Reasoning LLMs produce longer outputs, requiring speculative decoding drafters trained on extended sequences. Parallel drafting - predicting multiple tokens per forward pass - offe…
cs.CL2024
PPLqa: An Unsupervised Information-Theoretic Quality Metric for Comparing Generative Large Language Models
Gerald Friedland, Xin Huang, Yueying Cui +3
We propose PPLqa, an easy to compute, language independent, information-theoretic metric to measure the quality of responses of generative Large Language Models (LLMs) in an unsupe…