1 paper
Nianli Peng, Muhang Tian, Brandon Fain
We study multi-objective reinforcement learning with nonlinear preferences over trajectories. That is, we maximize the expected value of a nonlinear function over accumulated rewar…