2 papers
cs.LG2026
Regularized Reward-Punishment Reinforcement Learning
Jiexin Wang, Eiji Uchibe
We propose KL-Coupled Policy Regularization (KCPR), a policy coordination framework for Reward-Punishment Reinforcement Learning (RPRL). Based on KCPR, we derive KL-Coupled Soft Op…
cs.LG2024
Reward-Punishment Reinforcement Learning with Maximum Entropy
Jiexin Wang, Eiji Uchibe
We introduce the ``soft Deep MaxPain'' (softDMP) algorithm, which integrates the optimization of long-term policy entropy into reward-punishment reinforcement learning objectives.…