generalization bounds 1large language models 1model compression 1pac-bayes 1reinforcement learning 1
From the 1 of 17 linked papers with an AI index.
3 citations · 3 across the 7 of their papers we have counts for
Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards
Yuxuan Zhu, Rohan Alur, Daniel Kang
The paper derives the first non‑vacuous PAC‑Bayes generalization bounds for parameter‑efficient reinforcement learning with verifiable rewards applied to billion‑parameter language…
cs.LG2026
Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards
Yuxuan Zhu, Daniel Kang
Reinforcement learning with verifiable rewards (RLVR) has driven recent capability advances of large language models across various domains. Recent studies suggest that improved RL…