1 paper
Yifan Wu, Junjie Lei, Wenjie Huang
Risk-aware Q-learning (RaQL) provides a model-free, two-timescale estimator for dynamic risk objectives, but its finite-budget behavior remains fragile: fixed inner-loop hyperparam…