1 paper · 1 filter
Zhihao Lin, Lin Wu, Zhen Tian +1
Exploration in reinforcement learning remains a critical challenge, as naive entropy maximization often results in high variance and inefficient policy updates. We introduce \textb…