2 papers
cs.LG2026
TriAxialKV: Toward Extreme Low-Precision KV-Cache Quantization for Agentic Inference Tasks
Hanzhang Shen, Haoran Wu, Yiren Zhao +1
Agentic workloads have emerged as a major workload for LLM inference. They differ significantly from chat-only workloads, requiring long-context processing, the ability to handle m…
cs.LG2025
ConCuR: Conciseness Makes State-of-the-Art Kernel Generation
Lingcheng Kong, Jiateng Wei, Hanzhang Shen +1
GPU kernel generation by LLMs has recently experienced rapid development, leveraging test-time scaling and reinforcement learning techniques. However, a key challenge for kernel ge…