2 papers
cs.CL2026
Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
Siye Wu, Kai Yang, Yuchen Cai +8
Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large language models, but covering multiple capabilities often involves training separate d…
stat.ML2026
Deciding When to Switch: E-Processes for Adaptive Minimax Training for Generative Adversarial Nets
Hyunjoo Kim, Sicheng Wu, Agastya Venkatraman +2
Modern data science increasingly gives rise to hypothesis-testing problems that are not naturally formulated in terms of parameters within prespecified statistical models. One impo…