3 papers
cs.LG2025
Double Horizon Model-Based Policy Optimization
Akihiro Kubo, Paavo Parmas, Shin Ishii
Model-based reinforcement learning (MBRL) reduces the cost of real-environment sampling by generating synthetic trajectories (called rollouts) from a learned dynamics model. Howeve…
cs.LG2025
Off-Policy Actor-Critic for Adversarial Observation Robustness: Virtual Alternative Training via Symmetric Policy Evaluation
Kosuke Nakanishi, Akihiro Kubo, Yuji Yasui +1
Recently, robust reinforcement learning (RL) methods designed to handle adversarial input observations have received significant attention, motivated by RL's inherent vulnerabiliti…
cs.LG2024
Robust off-policy Reinforcement Learning via Soft Constrained Adversary
Kosuke Nakanishi, Akihiro Kubo, Yuji Yasui +1
Recently, robust reinforcement learning (RL) methods against input observation have garnered significant attention and undergone rapid evolution due to RL's potential vulnerability…