1 paper
Zhaochun Ren, Na Huang, Yidan Wang +7
Learning reinforcement learning (RL)-based recommenders from historical user-item interaction sequences is vital to generate high-reward recommendations and improve long-term cumul…