3 papers
cs.RO2026
Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups
Zeyun Deng, Yuzhe Lu, Yawei Wang +6
GRPO is increasingly used for reinforcement learning of vision-language-action (VLA) policies because, unlike PPO, it does not require training a critic. This simplification comes…
cs.LG2026
Analytical Correction for Subsampling Bias in Drifting Models
Jiaru Zhang, Zeyun Deng, Juanwu Lu +2
Drifting models are capable one-step generative models trained to follow a drifting field. The field combines attractive and repulsive softmax-weighted centroids over the data and…
cs.LG2025
Energy-Based Transfer for Reinforcement Learning
Zeyun Deng, Jasorsi Ghosh, Fiona Xie +3
Reinforcement learning algorithms often suffer from poor sample efficiency, making them challenging to apply in multi-task or continual learning settings. Efficiency can be improve…