papers
Publications (12)
cs.LG2026
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
Simon Sinong Zhan, Qingyuan Wu, Philip Wang +4
cs.LG2024
Variational Delayed Policy Optimization
Qingyuan Wu, Simon Sinong Zhan, Yixuan Wang +5
cs.CV2026
CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL
Zhenyang Ni, Yijiang Li, Ruochen Jiao +7
cs.LG2024
Inverse Delayed Reinforcement Learning
Simon Sinong Zhan, Qingyuan Wu, Zhian Ruan +6
cs.LG2024
Boosting Reinforcement Learning with Strongly Delayed Feedback Through Auxiliary Short Delays
Qingyuan Wu, Simon Sinong Zhan, Yixuan Wang +6
cs.LG2026
A Unified Framework for Rethinking Policy Divergence Measures in GRPO
Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan +6
cs.LG2023
State-Wise Safe Reinforcement Learning With Pixel Observations
Simon Sinong Zhan, Yixuan Wang, Qingyuan Wu +3
eess.SY2023
Enforcing Hard Constraints with Soft Barriers: Safe Reinforcement Learning in Unknown Stochastic Environments
Yixuan Wang, Simon Sinong Zhan, Ruochen Jiao +6
cs.LG2025
Directly Forecasting Belief for Reinforcement Learning with Delays
Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan +6
cs.AI2026
SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents
Simon Sinong Zhan, Yao Liu, Philip Wang +13
cs.IR2026
LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries
Jiacheng Lin, Kun Qian, Arvind Srinivasan +15
cs.LG2026
Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping
Simon Sinong Zhan, Philip Wang, Qingyuan Wu +4