5 papers
Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups
Zeyun Deng, Yuzhe Lu, Yawei Wang +6
GRPO is increasingly used for reinforcement learning of vision-language-action (VLA) policies because, unlike PPO, it does not require training a critic. This simplification comes…
PoseShield: Neural Collision Fields for Human Self-Collision Resolution
Zhengyuan Li, Zeyun Deng, Yifan Shen +7
Self-collision remains a persistent challenge in SMPL-based human pose estimation and motion generation. Under extreme articulations or stochastic motion synthesis, generated meshe…
Analytical Correction for Subsampling Bias in Drifting Models
Jiaru Zhang, Zeyun Deng, Juanwu Lu +2
Drifting models are capable one-step generative models trained to follow a drifting field. The field combines attractive and repulsive softmax-weighted centroids over the data and…
Energy-Based Transfer for Reinforcement Learning
Zeyun Deng, Jasorsi Ghosh, Fiona Xie +3
Reinforcement learning algorithms often suffer from poor sample efficiency, making them challenging to apply in multi-task or continual learning settings. Efficiency can be improve…
Sparse Mixture-of-Experts for Non-Uniform Noise Reduction in MRI Images
Zeyun Deng, Joseph Campbell
Magnetic Resonance Imaging (MRI) is an essential diagnostic tool in clinical settings, but its utility is often hindered by noise artifacts introduced during the imaging process. E…