3 papers
cs.LG2026
Score-Based One-step MeanFlow Policy Optimization
Kyungyoon Kim, Donghyeon Ki, Hee-Jun Ahn +1
Diffusion and flow matching have emerged as expressive policy classes in reinforcement learning, but their reliance on multi-step denoising imposes substantial computational overhe…
cs.LG2026
Direct Soft-Policy Sampling via Langevin Dynamics
Donghyeon Ki, Hee-Jun Ahn, Kyungyoon Kim +1
Soft policies in reinforcement learning define policies as Boltzmann distributions over state-action value functions, providing a principled mechanism for balancing exploration and…
cs.LG2025
Actor-Critic without Actor
Donghyeon Ki, Hee-Jun Ahn, Kyungyoon Kim +1
Actor-critic methods constitute a central paradigm in reinforcement learning (RL), coupling policy evaluation with policy improvement. While effective across many domains, these me…