1 paper
Yifan Zhou, Sachin Grover, Mohamed El Mistiri +7
Reinforcement Learning (RL) traditionally relies on scalar reward signals, limiting its ability to leverage the rich semantic knowledge often available in real-world tasks. In cont…