2 papers
cs.LG2025
RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting
Siqi Wang, Hailong Yang, Junjie Zhu +3
Reinforcement Learning from Human Feedback (RLHF) is an important fine-tuning technique for large language models (LLMs) and comprises three stages: generation, inference, and trai…
cs.DC2024
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
Siqi Wang, Hailong Yang, Xuezhu Wang +10
Large language models (LLM) have recently attracted surging interest due to their outstanding capabilities across various domains. However, enabling efficient LLM inference is chal…