papers

Publications (25)

cs.CL2026

Kimi K2.5: Visual Agentic Intelligence

Kimi Team, Tongtong Bai, Yifan Bai +322

cs.LG2025

Large Language Model-Enhanced Multi-Armed Bandits

Jiahang Sun, Zhiyong Wang, Runhan Yang +3

cs.AI2025

Kimina-Prover Preview: Towards Large Formal Reasoning Models with Reinforcement Learning

Haiming Wang, Mert Unsal, Xiaohan Lin +37

cs.LG2021

On the Optimality of Batch Policy Optimization Algorithms

Chenjun Xiao, Yifan Wu, Tor Lattimore +5

cs.LG2025

-DQN: Improving Deep Q-Learning By Evolving the Behavior

Hongming Zhang, Fengshuo Bai, Chenjun Xiao +3

cs.LG2023

Iteratively Refined Behavior Regularization for Offline Reinforcement Learning

Xiaohan Hu, Yi Ma, Chenjun Xiao +2

cs.LG2025

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies

Yi Ma, Hongyao Tang, Chenjun Xiao +4

cs.LG2024

Hindsight Preference Learning for Offline Preference-based Reinforcement Learning

Chen-Xiao Gao, Shengjun Fang, Chenjun Xiao +2

cs.LG2024

HarmonyDream: Task Harmonization Inside World Models

Haoyu Ma, Jialong Wu, Ningya Feng +5

cs.LG2023

The In-Sample Softmax for Offline Reinforcement Learning

Chenjun Xiao, Han Wang, Yangchen Pan +2

cs.LG2025

Target Networks and Over-parameterization Stabilize Off-policy Bootstrapping with Function Approximation

Fengdi Che, Chenjun Xiao, Jincheng Mei +6

cs.LG2023

The Curse of Passive Data Collection in Batch Reinforcement Learning

Chenjun Xiao, Ilbin Lee, Bo Dai +2

cs.LG2026

Kimi K2: Open Agentic Intelligence

Kimi Team, Yifan Bai, Yiping Bao +195

cs.LG2019

Learning to Combat Compounding-Error in Model-Based Reinforcement Learning

Chenjun Xiao, Yifan Wu, Chen Ma +2

cs.AI2025

Kimi k1.5: Scaling Reinforcement Learning with LLMs

Kimi Team, Angang Du, Bofei Gao +93

cs.LG2023

Conditionally Optimistic Exploration for Cooperative Deep Multi-Agent Reinforcement Learning

Xutong Zhao, Yangchen Pan, Chenjun Xiao +2

cs.LG2024

Diffusion Spectral Representation for Reinforcement Learning

Dmitry Shribak, Chen-Xiao Gao, Yitong Li +2

cs.CL2026

Kimi K3: Open Frontier Intelligence

Kimi Team, Tongtong Bai, Yifan Bai +398

cs.LG2025

An MRP Formulation for Supervised Learning: Generalized Temporal Difference Learning Models

Yangchen Pan, Junfeng Wen, Chenjun Xiao +1

cs.LG2025

Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning

Chen-Xiao Gao, Chenyang Wu, Mingjun Cao +3

cs.LG2024

Provable Representation with Efficient Planning for Partial Observable Reinforcement Learning

Hongming Zhang, Tongzheng Ren, Chenjun Xiao +2

cs.LG2023

Rethinking Decision Transformer via Hierarchical Reinforcement Learning

Yi Ma, Chenjun Xiao, Hebin Liang +1

cs.LG2021

Understanding the Effect of Stochasticity in Policy Optimization

Jincheng Mei, Bo Dai, Chenjun Xiao +2

cs.LG2022

On the Global Convergence Rates of Softmax Policy Gradient Methods

Jincheng Mei, Chenjun Xiao, Csaba Szepesvari +1

cs.LG2023

Latent Variable Representation for Reinforcement Learning

Tongzheng Ren, Chenjun Xiao, Tianjun Zhang +5