3 papers
cs.DB2025
Category-Aware Semantic Caching for Heterogeneous LLM Workloads
Chen Wang, Xunzhuo Liu, Yue Zhu +3
LLM serving systems process heterogeneous query workloads where different categories exhibit different characteristics. Code queries cluster densely in embedding space while conver…
cs.ET2025
When to Reason: Semantic Router for vLLM
Chen Wang, Xunzhuo Liu, Yuhan Liu +4
Large Language Models (LLMs) demonstrate substantial accuracy gains when augmented with reasoning modes such as chain-of-thought and inference-time scaling. However, reasoning also…
cs.DB2025
Text to Query Plans for Question Answering on Large Tables
Yipeng Zhang, Chen Wang, Yuzhe Zhang +1
Efficient querying and analysis of large tabular datasets remain significant challenges, especially for users without expertise in programming languages like SQL. Text-to-SQL appro…