collaborators

9 papers

cs.AI2026

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

Zhongyi Li, Wan Tian, Jingyu Chen +8

Multi-agent collaboration has emerged as a powerful paradigm for enhancing the reasoning capabilities of large language models, yet it suffers from interaction-level ambiguity that…

cs.LG2026

Omni-Masked Gradient Descent: Memory-Efficient Optimization via Mask Traversal with Improved Convergence

Hui Yang, Tao Ren, Jinyang Jiang +2

Memory-efficient optimization methods have recently gained increasing attention for scaling full-parameter training of large language models under the GPU-memory bottleneck. Existi…

cs.LG2025

Stochastic Approximation Methods for Distortion Risk Measure Optimization

Jinyang Jiang, Bernd Heidergott, Jiaqiao Hu +1

Distortion Risk Measures (DRMs) capture risk preferences in decision-making and serve as general criteria for managing uncertainty. This paper proposes gradient descent algorithms…

cs.LG2025

RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training

Tao Ren, Jinyang Jiang, Hui Yang +10

Reinforcement learning with verifiable reward has recently emerged as a central paradigm for post-training large language models (LLMs); however, prevailing mean-based methods, suc…

quant-ph2025

A Parameter-Efficient Quantum Anomaly Detection Method on a Superconducting Quantum Processor

Maida Wang, Jinyang Jiang, Peter V. Coveney

Quantum machine learning has gained attention for its potential to address computational challenges. However, whether those algorithms can effectively solve practical problems and…

cs.LG2025

CoNNect: Connectivity-Based Regularization for Structural Pruning

Christian Franssen, Jinyang Jiang, Yijie Peng +1

Pruning encompasses a range of techniques aimed at increasing the sparsity of neural networks (NNs). These techniques can generally be framed as minimizing a loss function subject…