5 papers · 1 filter
Co-Evolving Policy Distillation
Naibin Gu, Chenxu Yang, Qingyi Si +7
RLVR and OPD have become standard paradigms for post-training. We provide a unified analysis of these two paradigms in consolidating multiple expert capabilities into a single mode…
Near-Future Policy Optimization
Chuanyu Qin, Chenxu Yang, Qingyi Si +6
Reinforcement learning with verifiable rewards (RLVR) has become a core post-training recipe. Introducing suitable off-policy trajectories into on-policy exploration accelerates RL…
Self-Distilled RLVR
Chenxu Yang, Chuanyu Qin, Qingyi Si +7
On-policy distillation (OPD) has become a popular training paradigm in the LLM community. This paradigm selects a larger model as the teacher to provide dense, fine-grained signals…
LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
Wenbo Wu, Qingyi Si, Xiurui Pan +2
While Key-Value (KV) cache succeeds in reducing redundant computations in auto-regressive models, it introduces significant memory overhead, limiting its practical deployment in lo…
Sparse Attention across Multiple-context KV Cache
Ziyi Cao, Qingyi Si, Jingbin Zhang +1
Large language models face significant cost challenges in long-sequence inference. To address this, reusing historical Key-Value (KV) Cache for improved inference efficiency has be…