3 papers
cs.CL2026
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
Sibo Xiao, Jinyuan Fu, Zhongle Xie +1
Accelerating the inference of large language models (LLMs) has been a critical challenge in generative AI. Speculative decoding (SD) substantially improves LLM inference efficiency…
cs.LG2026
Doubly Robust Estimation of Causal Effects in Strategic Equilibrium Systems
Sibo Xiao
We introduce the Strategic Doubly Robust (SDR) estimator, a novel framework that integrates strategic equilibrium modeling with doubly robust estimation for causal inference in str…
cs.CL2025
Long Context Scaling: Divide and Conquer via Multi-Agent Question-driven Collaboration
Sibo Xiao, Zixin Lin, Wenyang Gao +2
Processing long contexts has become a critical capability for modern large language models (LLMs). Existing works leverage agent-based divide-and-conquer methods for processing lon…