activity
20242026
collaborators

6 papers

cs.CL2026

Sparsity Induction for Accurate Post-Training Pruning of Large Language Models

Minhao Jiang, Zhikai Li, Xuewen Liu +3

Large language models have demonstrated capabilities in text generation, while their increasing parameter scales present challenges in computational and memory efficiency. Post-tra…

cs.CL2026

RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM Generation

Pengcheng Jiang, Lang Cao, Ruike Zhu +5

Large language models (LLMs) have achieved impressive performance on knowledge-intensive tasks, yet they often struggle with multi-step reasoning due to the unstructured nature of…

cs.CV2025

DilateQuant: Accurate and Efficient Diffusion Quantization via Weight Dilation

Xuewen Liu, Zhikai Li, Minhao Jiang +3

Model quantization is a promising method for accelerating and compressing diffusion models. Nevertheless, since post-training quantization (PTQ) fails catastrophically at low-bit c…

cs.LG2025

RAST: Reasoning Activation in LLMs via Small-model Transfer

Siru Ouyang, Xinyu Zhu, Zilin Xiao +3

Reinforcement learning (RL) has become a powerful approach for improving the reasoning capabilities of large language models (LLMs), as evidenced by recent successes such as OpenAI…

cs.CL2025

Reasoning-Enhanced Healthcare Predictions with Knowledge Graph Community Retrieval

Pengcheng Jiang, Cao Xiao, Minhao Jiang +4

Large language models (LLMs) have demonstrated significant potential in clinical decision support. Yet LLMs still suffer from hallucinations and lack fine-grained contextual medica…

cs.CL2024

Temperature-Centric Investigation of Speculative Decoding with Knowledge Distillation

Siru Ouyang, Shuohang Wang, Minhao Jiang +4

Speculative decoding stands as a pivotal technique to expedite inference in autoregressive (large) language models. This method employs a smaller draft model to speculate a block o…