Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Start Classifying: Categorical Critics for LLM Reinforcement Learning
Zhijian Zhou, Long Li, Xuan Zhang +7
Proximal Policy Optimization (PPO) for large language models typically trains its critic by mean-squared-error (MSE) regression on scalar value targets. Although scalar MSE is stat…
cs.LG2025
Guiding Diffusion Models with Reinforcement Learning for Stable Molecule Generation
Zhijian Zhou, Junyi An, Zongkai Liu +5
Generating physically realistic 3D molecular structures remains a core challenge in molecular generative modeling. While diffusion models equipped with equivariant neural networks…