Pu Li, Zhigang Lin, Qiang Wu +3
While RL has become a promising tool for refining world models, existing methods largely rely on conservative rollouts near the training distribution, limiting exploration, behavio…