1 citations · 1 across the 2 of their papers we have counts for
2 papers
cs.LG2023
Generalization Across Observation Shifts in Reinforcement Learning
Anuj Mahajan, Amy Zhang
Learning policies which are robust to changes in the environment are critical for real world deployment of Reinforcement Learning agents. They are also necessary for achieving good…
cs.LG2023★ 1 cited
Trust-Region-Free Policy Optimization for Stochastic Policies
Mingfei Sun, Benjamin Ellis, Anuj Mahajan +3
Trust Region Policy Optimization (TRPO) is an iterative method that simultaneously maximizes a surrogate objective and enforces a trust region constraint over consecutive policies…