papers

Publications (223)

cs.LG2025

Reinforcement Learning from Human Feedback with Active Queries

Kaixuan Ji, Jiafan He, Quanquan Gu

cs.LG2024

Fast Sampling via Discrete Non-Markov Diffusion Models with Predetermined Transition Time

Zixiang Chen, Huizhuo Yuan, Yongqian Li +3

cs.LG2023

Efficient Privacy-Preserving Stochastic Nonconvex Optimization

Lingxiao Wang, Bargav Jayaraman, David Evans +1

cs.LG2025

Elucidating the Design Space of Multimodal Protein Language Models

Cheng-Yen Hsieh, Xinyou Wang, Daiheng Zhang +5

cs.LG2024

Pure Exploration in Asynchronous Federated Bandits

Zichen Wang, Chuanhao Li, Chenyu Song +3

cs.LG2025

Convergence of Score-Based Discrete Diffusion Models: A Discrete-Time Analysis

Zikun Zhang, Zixiang Chen, Quanquan Gu

cs.LG2019

Algorithm-Dependent Generalization Bounds for Overparameterized Deep Residual Networks

Spencer Frei, Yuan Cao, Quanquan Gu

cs.LG2023

Cooperative Multi-Agent Reinforcement Learning: Asynchronous Communication and Linear Function Approximation

Yifei Min, Jiafan He, Tianhao Wang +1

cs.LG2024

Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path

Qiwei Di, Jiafan He, Dongruo Zhou +1

cs.LG2021

Uniform-PAC Bounds for Reinforcement Learning with Linear Function Approximation

Jiafan He, Dongruo Zhou, Quanquan Gu

cs.LG2025

Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees

Yongtao Wu, Luca Viano, Yihang Chen +4

cs.LG2025

Robust Layerwise Scaling Rules by Proper Weight Decay Tuning

Zhiyuan Fan, Yifeng Liu, Qingyue Zhao +2

cs.CL2024

Domain Specialization as the Key to Make Large Language Models Disruptive: A Comprehensive Survey

Chen Ling, Xujiang Zhao, Jiaying Lu +21

cs.LG2022

A General Framework for Sample-Efficient Function Approximation in Reinforcement Learning

Zixiang Chen, Chris Junchi Li, Angela Yuan +2

cs.LG2020

Understanding the Intrinsic Robustness of Image Distributions using Conditional Generative Models

Xiao Zhang, Jinghui Chen, Quanquan Gu +1

stat.ML2015

Sharp Computational-Statistical Phase Transitions via Oracle Computational Model

Zhaoran Wang, Quanquan Gu, Han Liu

cs.LG2022

Nearly Optimal Algorithms for Linear Contextual Bandits with Adversarial Corruptions

Jiafan He, Dongruo Zhou, Tong Zhang +1

cs.LG2022

Learning Two-Player Mixture Markov Games: Kernel Function Approximation and Correlated Equilibrium

Chris Junchi Li, Dongruo Zhou, Quanquan Gu +1

cs.LG2025

A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation

Heyang Zhao, Jiafan He, Quanquan Gu

cs.LG2023

The Implicit Bias of Batch Normalization in Linear Models and Two-layer Linear Convolutional Neural Networks

Yuan Cao, Difan Zou, Yuanzhi Li +1

cs.LG2026

Group Representational Position Encoding

Yifan Zhang, Zixiang Chen, Yifeng Liu +6

stat.ML2018

A Unified Framework for Low-Rank plus Sparse Matrix Recovery

Xiao Zhang, Lingxiao Wang, Quanquan Gu

stat.ML2017

Speeding Up Latent Variable Gaussian Graphical Model Estimation via Nonconvex Optimizations

Pan Xu, Jian Ma, Quanquan Gu

cs.LG2020

On the Global Convergence of Training Deep Linear ResNets

Difan Zou, Philip M. Long, Quanquan Gu

cs.LG2019

A Frank-Wolfe Framework for Efficient and Effective Adversarial Attacks

Jinghui Chen, Dongruo Zhou, Jinfeng Yi +1

cs.LG2024

Guided Discrete Diffusion for Electronic Health Record Generation

Jun Han, Zixiang Chen, Yongqian Li +4

cs.LG2026

Breaking the Total Variance Barrier: Sharp Sample Complexity for Linear Heteroscedastic Bandits with Fixed Action Set

Heyang Zhao, Tianyuan Jin, Weixin Wang +3

cs.LG2021

How Much Over-parameterization Is Sufficient to Learn Deep ReLU Networks?

Zixiang Chen, Yuan Cao, Difan Zou +1

cs.LG2024

Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation

Huizhuo Yuan, Zixiang Chen, Kaixuan Ji +1

cs.LG2022

On the Convergence and Robustness of Adversarial Training

Yisen Wang, Xingjun Ma, James Bailey +3

cs.LG2020

Agnostic Learning of a Single Neuron with Gradient Descent

Spencer Frei, Yuan Cao, Quanquan Gu

cs.LG2025

On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference

Yue Yu, Qiwei Di, Quanquan Gu +1

q-bio.QM2024

ProteinBench: A Holistic Evaluation of Protein Foundation Models

Fei Ye, Zaixiang Zheng, Dongyu Xue +7

cs.LG2023

Robust Learning with Progressive Data Expansion Against Spurious Correlation

Yihe Deng, Yu Yang, Baharan Mirzasoleiman +1

cs.LG2024

On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization

Dongruo Zhou, Jinghui Chen, Yuan Cao +2

cs.LG2023

The Benefits of Mixup for Feature Learning

Difan Zou, Yuan Cao, Yuanzhi Li +1

q-bio.BM2025

SeedFold: Scaling Biomolecular Structure Prediction

Yi Zhou, Chan Lu, Yiming Ma +6

cs.LG2023

Variance-Dependent Regret Bounds for Linear Bandits and Reinforcement Learning: Adaptivity and Computational Efficiency

Heyang Zhao, Jiafan He, Dongruo Zhou +2

cs.LG2026

MARS-M: When Variance Reduction Meets Matrices

Yifeng Liu, Angela Yuan, Quanquan Gu

cs.LG2025

Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance

Linxi Zhao, Yihe Deng, Weitong Zhang +1

cs.LG2020

Optimization Theory for ReLU Neural Networks Trained with Normalization Layers

Yonatan Dukler, Quanquan Gu, Guido Montúfar

cs.LG2025

An All-Atom Generative Model for Designing Protein Complexes

Ruizhe Chen, Dongyu Xue, Xiangxin Zhou +3

cs.LG2022

Learning Stochastic Shortest Path with Linear Function Approximation

Yifei Min, Jiafan He, Tianhao Wang +1

stat.ML2015

Towards Faster Rates and Oracle Property for Low-Rank Matrix Estimation

Huan Gui, Quanquan Gu

cs.LG2022

Exploring Architectural Ingredients of Adversarially Robust Deep Neural Networks

Hanxun Huang, Yisen Wang, Sarah Monazam Erfani +3

q-bio.BM2024

Antigen-Specific Antibody Design via Direct Energy-based Preference Optimization

Xiangxin Zhou, Dongyu Xue, Ruizhe Chen +3

cs.LG2023

Benign Overfitting for Two-layer ReLU Convolutional Neural Networks

Yiwen Kou, Zixiang Chen, Yuanzhou Chen +1

cs.CL2024

TrustLLM: Trustworthiness in Large Language Models

Yue Huang, Lichao Sun, Haoran Wang +67

cs.LG2026

Protein Autoregressive Modeling via Multiscale Structure Generation

Yanru Qu, Cheng-Yen Hsieh, Zaixiang Zheng +2

cs.LG2026

Near-Optimal Regret for KL-Regularized Multi-Armed Bandits

Kaixuan Ji, Qingyue Zhao, Heyang Zhao +2

cs.LG2025

Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback

Qiwei Di, Jiafan He, Quanquan Gu

cs.LG2026

Towards Simple and Provable Parameter-Free Adaptive Gradient Methods

Yuanzhe Tao, Yifeng Liu, Huizhuo Yuan +3

cs.LG2024

DPLM-2: A Multimodal Diffusion Protein Language Model

Xinyou Wang, Zaixiang Zheng, Fei Ye +3

cs.LG2022

Benign Overfitting in Two-layer Convolutional Neural Networks

Yuan Cao, Zixiang Chen, Mikhail Belkin +1

cs.LG2026

Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models

Chenyang Zhang, Qingyue Zhao, Quanquan Gu +1

cs.LG2022

On the Convergence of Certified Robust Training with Interval Bound Propagation

Yihan Wang, Zhouxing Shi, Quanquan Gu +1

cs.LG2025

RSPO: Regularized Self-Play Alignment of Large Language Models

Xiaohang Tang, Sangwoong Yoon, Seongho Son +3

cs.LG2026

Unlocking Feature Learning in Gated Delta Networks at Scale

Yifeng Liu, Quanquan Gu

cs.LG2025

Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization

Kaixuan Ji, Guanlin Liu, Ning Dai +6

stat.ML2017

A Universal Variance Reduction-Based Catalyst for Nonconvex Low-Rank Matrix Recovery

Lingxiao Wang, Xiao Zhang, Quanquan Gu

cs.LG2021

Adaptive Differentially Private Empirical Risk Minimization

Xiaoxia Wu, Lingxiao Wang, Irina Cristali +2

cs.CL2024

PrivacyMind: Large Language Models Can Be Contextual Privacy Protection Learners

Yijia Xiao, Yiqiao Jin, Yushi Bai +10

cs.LG2023

On the Interplay Between Misspecification and Sub-optimality Gap in Linear Contextual Bandits

Weitong Zhang, Jiafan He, Zhiyuan Fan +1

cs.LG2020

Neural Contextual Bandits with UCB-based Exploration

Dongruo Zhou, Lihong Li, Quanquan Gu

cs.LG2022

Computationally Efficient Horizon-Free Reinforcement Learning for Linear Mixture MDPs

Dongruo Zhou, Quanquan Gu

cs.LG2021

Self-training Converts Weak Learners to Strong Learners in Mixture Models

Spencer Frei, Difan Zou, Zixiang Chen +1

math.OC2017

Third-order Smoothness Helps: Even Faster Stochastic Optimization Algorithms for Finding Local Minima

Yaodong Yu, Pan Xu, Quanquan Gu

cs.LG2025

Designing Cyclic Peptides via Harmonic SDE with Atom-Bond Modeling

Xiangxin Zhou, Mingyu Li, Yi Xiao +5

cs.LG2021

Neural Thompson Sampling

Weitong Zhang, Dongruo Zhou, Lihong Li +1

cs.LG2021

Faster Convergence of Stochastic Gradient Langevin Dynamics for Non-Log-Concave Sampling

Difan Zou, Pan Xu, Quanquan Gu

cs.LG2020

RayS: A Ray Searching Method for Hard-label Adversarial Attack

Jinghui Chen, Quanquan Gu

cs.LG2020

Towards Understanding the Spectral Bias of Deep Learning

Yuan Cao, Zhiying Fang, Yue Wu +2

cs.LG2021

Batched Neural Bandits

Quanquan Gu, Amin Karbasi, Khashayar Khosravi +2

cs.AI2025

Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment

Yifan Zhang, Ge Zhang, Yue Wu +2

cs.LG2022

The Benefits of Implicit Regularization from SGD in Least Squares Problems

Difan Zou, Jingfeng Wu, Vladimir Braverman +3

cs.LG2026

On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization

Kaixuan Ji, Qiwei Di, Heyang Zhao +2

cs.LG2021

Provably Efficient Reinforcement Learning for Discounted MDPs with Feature Mapping

Dongruo Zhou, Jiafan He, Quanquan Gu

cs.LG2024

Achieving Constant Regret in Linear Markov Decision Processes

Weitong Zhang, Zhiyuan Fan, Jiafan He +1

cs.LG2025

Best-of-Majority: Minimax-Optimal Strategy for Pass@ Inference Scaling

Qiwei Di, Kaixuan Ji, Xuheng Li +2

cs.LG2022

Towards Understanding Mixture of Experts in Deep Learning

Zixiang Chen, Yihe Deng, Yue Wu +2

cs.LG2022

Learning Neural Contextual Bandits Through Perturbed Rewards

Yiling Jia, Weitong Zhang, Dongruo Zhou +2

cs.LG2023

Finite-Sample Analysis of Learning High-Dimensional Single ReLU Neuron

Jingfeng Wu, Difan Zou, Zixiang Chen +3

stat.ML2015

Statistical Limits of Convex Relaxations

Zhaoran Wang, Quanquan Gu, Han Liu

math.OC2022

Faster Perturbed Stochastic Gradient Methods for Finding Local Minima

Zixiang Chen, Dongruo Zhou, Quanquan Gu

cs.LG2020

Double Explore-then-Commit: Asymptotic Optimality and Beyond

Tianyuan Jin, Pan Xu, Xiaokui Xiao +1

cs.LG2026

Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence

Shiyuan Zhang, Qiwei Di, Xuheng Li +1

cs.CV2025

LLaVA-Critic: Learning to Evaluate Multimodal Models

Tianyi Xiong, Xiyao Wang, Dong Guo +5

cs.LG2025

Variance-Dependent Regret Lower Bounds for Contextual Bandits

Jiafan He, Quanquan Gu

cs.LG2022

Nearly Minimax Optimal Reinforcement Learning for Discounted MDPs

Jiafan He, Dongruo Zhou, Quanquan Gu

stat.ML2020

Global Convergence of Langevin Dynamics Based Algorithms for Nonconvex Optimization

Pan Xu, Jinghui Chen, Difan Zou +1

q-bio.BM2024

Protein Conformation Generation via Force-Guided SE(3) Diffusion Models

Yan Wang, Lihao Wang, Yuning Shen +4

cs.LG2020

Closing the Generalization Gap of Adaptive Gradient Methods in Training Deep Neural Networks

Jinghui Chen, Dongruo Zhou, Yiqi Tang +3

stat.ML2024

How Many Pretraining Tasks Are Needed for In-Context Learning of Linear Regression?

Jingfeng Wu, Difan Zou, Zixiang Chen +3

cs.LG2025

MARS: Unleashing the Power of Variance Reduction for Training Large Models

Huizhuo Yuan, Yifeng Liu, Shuang Wu +2

cs.LG2026

Scalable Spatio-Temporal SE(3) Diffusion for Long-Horizon Protein Dynamics

Nima Shoghi, Yuxuan Liu, Yuning Shen +3

cs.LG2018

Stochastic Variance-Reduced Cubic Regularized Newton Method

Dongruo Zhou, Pan Xu, Quanquan Gu

cs.LG2024

Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Zixiang Chen, Yihe Deng, Huizhuo Yuan +2

cs.LG2022

Provably Efficient Reinforcement Learning with Linear Function Approximation Under Adaptivity Constraints

Tianhao Wang, Dongruo Zhou, Quanquan Gu

cs.LG2026

Towards a Sharp Analysis of Offline Policy Learning for -Divergence-Regularized Contextual Bandits

Qingyue Zhao, Kaixuan Ji, Heyang Zhao +2

cs.CL2026

SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving

Wendong Xu, Jing Xiong, Chenyang Zhao +16