1 paper
Bassel El Mabsout, Shahin Roozkhosh, Siddharth Mysore +2
Fine-tuning simulation-trained RL agents with real-world data often degrades crucial behaviors due to limited or skewed data distributions. We argue that designer priorities exist…