5 papers
Score-Based One-step MeanFlow Policy Optimization
Kyungyoon Kim, Donghyeon Ki, Hee-Jun Ahn +1
Diffusion and flow matching have emerged as expressive policy classes in reinforcement learning, but their reliance on multi-step denoising imposes substantial computational overhe…
Direct Soft-Policy Sampling via Langevin Dynamics
Donghyeon Ki, Hee-Jun Ahn, Kyungyoon Kim +1
Soft policies in reinforcement learning define policies as Boltzmann distributions over state-action value functions, providing a principled mechanism for balancing exploration and…
Prior-Guided Diffusion Planning for Offline Reinforcement Learning
Donghyeon Ki, JunHyeok Oh, Seong-Woong Shim +1
Diffusion models have recently gained prominence in offline reinforcement learning due to their ability to effectively learn high-performing, generalizable policies from static dat…
Adaptive Non-uniform Timestep Sampling for Accelerating Diffusion Model Training
Myunsoo Kim, Donghyeon Ki, Seong-Woong Shim +1
As a highly expressive generative model, diffusion models have demonstrated exceptional success across various domains, including image generation, natural language processing, and…
Actor-Critic without Actor
Donghyeon Ki, Hee-Jun Ahn, Kyungyoon Kim +1
Actor-critic methods constitute a central paradigm in reinforcement learning (RL), coupling policy evaluation with policy improvement. While effective across many domains, these me…