Publications (25)
Kimi K2.5: Visual Agentic Intelligence
Kimi Team, Tongtong Bai, Yifan Bai +322
Large Language Model-Enhanced Multi-Armed Bandits
Jiahang Sun, Zhiyong Wang, Runhan Yang +3
Kimina-Prover Preview: Towards Large Formal Reasoning Models with Reinforcement Learning
Haiming Wang, Mert Unsal, Xiaohan Lin +37
On the Optimality of Batch Policy Optimization Algorithms
Chenjun Xiao, Yifan Wu, Tor Lattimore +5
-DQN: Improving Deep Q-Learning By Evolving the Behavior
Hongming Zhang, Fengshuo Bai, Chenjun Xiao +3
Iteratively Refined Behavior Regularization for Offline Reinforcement Learning
Xiaohan Hu, Yi Ma, Chenjun Xiao +2
Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies
Yi Ma, Hongyao Tang, Chenjun Xiao +4
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
Chen-Xiao Gao, Shengjun Fang, Chenjun Xiao +2
HarmonyDream: Task Harmonization Inside World Models
Haoyu Ma, Jialong Wu, Ningya Feng +5
The In-Sample Softmax for Offline Reinforcement Learning
Chenjun Xiao, Han Wang, Yangchen Pan +2
Target Networks and Over-parameterization Stabilize Off-policy Bootstrapping with Function Approximation
Fengdi Che, Chenjun Xiao, Jincheng Mei +6
The Curse of Passive Data Collection in Batch Reinforcement Learning
Chenjun Xiao, Ilbin Lee, Bo Dai +2
Kimi K2: Open Agentic Intelligence
Kimi Team, Yifan Bai, Yiping Bao +195
Learning to Combat Compounding-Error in Model-Based Reinforcement Learning
Chenjun Xiao, Yifan Wu, Chen Ma +2
Kimi k1.5: Scaling Reinforcement Learning with LLMs
Kimi Team, Angang Du, Bofei Gao +93
Conditionally Optimistic Exploration for Cooperative Deep Multi-Agent Reinforcement Learning
Xutong Zhao, Yangchen Pan, Chenjun Xiao +2
Diffusion Spectral Representation for Reinforcement Learning
Dmitry Shribak, Chen-Xiao Gao, Yitong Li +2
Kimi K3: Open Frontier Intelligence
Kimi Team, Tongtong Bai, Yifan Bai +398
An MRP Formulation for Supervised Learning: Generalized Temporal Difference Learning Models
Yangchen Pan, Junfeng Wen, Chenjun Xiao +1
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
Chen-Xiao Gao, Chenyang Wu, Mingjun Cao +3
Provable Representation with Efficient Planning for Partial Observable Reinforcement Learning
Hongming Zhang, Tongzheng Ren, Chenjun Xiao +2
Rethinking Decision Transformer via Hierarchical Reinforcement Learning
Yi Ma, Chenjun Xiao, Hebin Liang +1
Understanding the Effect of Stochasticity in Policy Optimization
Jincheng Mei, Bo Dai, Chenjun Xiao +2
On the Global Convergence Rates of Softmax Policy Gradient Methods
Jincheng Mei, Chenjun Xiao, Csaba Szepesvari +1
Latent Variable Representation for Reinforcement Learning
Tongzheng Ren, Chenjun Xiao, Tianjun Zhang +5