3 papers
cs.LG2025
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
Tao Ren, Jinyang Jiang, Hui Yang +10
Reinforcement learning with verifiable reward has recently emerged as a central paradigm for post-training large language models (LLMs); however, prevailing mean-based methods, suc…
cs.LG2025
Forward Learning with Differential Privacy
Mingqian Feng, Zeliang Zhang, Jinyang Jiang +2
Differential privacy (DP) in deep learning is a critical concern as it ensures the confidentiality of training data while maintaining model utility. Existing DP training algorithms…
cs.LG2025
CoNNect: Connectivity-Based Regularization for Structural Pruning
Christian Franssen, Jinyang Jiang, Yijie Peng +1
Pruning encompasses a range of techniques aimed at increasing the sparsity of neural networks (NNs). These techniques can generally be framed as minimizing a loss function subject…