Publications (223)
Reinforcement Learning from Human Feedback with Active Queries
Kaixuan Ji, Jiafan He, Quanquan Gu
Fast Sampling via Discrete Non-Markov Diffusion Models with Predetermined Transition Time
Zixiang Chen, Huizhuo Yuan, Yongqian Li +3
Efficient Privacy-Preserving Stochastic Nonconvex Optimization
Lingxiao Wang, Bargav Jayaraman, David Evans +1
Elucidating the Design Space of Multimodal Protein Language Models
Cheng-Yen Hsieh, Xinyou Wang, Daiheng Zhang +5
Pure Exploration in Asynchronous Federated Bandits
Zichen Wang, Chuanhao Li, Chenyu Song +3
Convergence of Score-Based Discrete Diffusion Models: A Discrete-Time Analysis
Zikun Zhang, Zixiang Chen, Quanquan Gu
Algorithm-Dependent Generalization Bounds for Overparameterized Deep Residual Networks
Spencer Frei, Yuan Cao, Quanquan Gu
Cooperative Multi-Agent Reinforcement Learning: Asynchronous Communication and Linear Function Approximation
Yifei Min, Jiafan He, Tianhao Wang +1
Nearly Minimax Optimal Regret for Learning Linear Mixture Stochastic Shortest Path
Qiwei Di, Jiafan He, Dongruo Zhou +1
Uniform-PAC Bounds for Reinforcement Learning with Linear Function Approximation
Jiafan He, Dongruo Zhou, Quanquan Gu
Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees
Yongtao Wu, Luca Viano, Yihang Chen +4
Robust Layerwise Scaling Rules by Proper Weight Decay Tuning
Zhiyuan Fan, Yifeng Liu, Qingyue Zhao +2
Domain Specialization as the Key to Make Large Language Models Disruptive: A Comprehensive Survey
Chen Ling, Xujiang Zhao, Jiaying Lu +21
A General Framework for Sample-Efficient Function Approximation in Reinforcement Learning
Zixiang Chen, Chris Junchi Li, Angela Yuan +2
Understanding the Intrinsic Robustness of Image Distributions using Conditional Generative Models
Xiao Zhang, Jinghui Chen, Quanquan Gu +1
Sharp Computational-Statistical Phase Transitions via Oracle Computational Model
Zhaoran Wang, Quanquan Gu, Han Liu
Nearly Optimal Algorithms for Linear Contextual Bandits with Adversarial Corruptions
Jiafan He, Dongruo Zhou, Tong Zhang +1
Learning Two-Player Mixture Markov Games: Kernel Function Approximation and Correlated Equilibrium
Chris Junchi Li, Dongruo Zhou, Quanquan Gu +1
A Nearly Optimal and Low-Switching Algorithm for Reinforcement Learning with General Function Approximation
Heyang Zhao, Jiafan He, Quanquan Gu
The Implicit Bias of Batch Normalization in Linear Models and Two-layer Linear Convolutional Neural Networks
Yuan Cao, Difan Zou, Yuanzhi Li +1
Group Representational Position Encoding
Yifan Zhang, Zixiang Chen, Yifeng Liu +6
A Unified Framework for Low-Rank plus Sparse Matrix Recovery
Xiao Zhang, Lingxiao Wang, Quanquan Gu
Speeding Up Latent Variable Gaussian Graphical Model Estimation via Nonconvex Optimizations
Pan Xu, Jian Ma, Quanquan Gu
On the Global Convergence of Training Deep Linear ResNets
Difan Zou, Philip M. Long, Quanquan Gu
A Frank-Wolfe Framework for Efficient and Effective Adversarial Attacks
Jinghui Chen, Dongruo Zhou, Jinfeng Yi +1
Guided Discrete Diffusion for Electronic Health Record Generation
Jun Han, Zixiang Chen, Yongqian Li +4
Breaking the Total Variance Barrier: Sharp Sample Complexity for Linear Heteroscedastic Bandits with Fixed Action Set
Heyang Zhao, Tianyuan Jin, Weixin Wang +3
How Much Over-parameterization Is Sufficient to Learn Deep ReLU Networks?
Zixiang Chen, Yuan Cao, Difan Zou +1
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
Huizhuo Yuan, Zixiang Chen, Kaixuan Ji +1
On the Convergence and Robustness of Adversarial Training
Yisen Wang, Xingjun Ma, James Bailey +3
Agnostic Learning of a Single Neuron with Gradient Descent
Spencer Frei, Yuan Cao, Quanquan Gu
On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
Yue Yu, Qiwei Di, Quanquan Gu +1
ProteinBench: A Holistic Evaluation of Protein Foundation Models
Fei Ye, Zaixiang Zheng, Dongyu Xue +7
Robust Learning with Progressive Data Expansion Against Spurious Correlation
Yihe Deng, Yu Yang, Baharan Mirzasoleiman +1
On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization
Dongruo Zhou, Jinghui Chen, Yuan Cao +2
The Benefits of Mixup for Feature Learning
Difan Zou, Yuan Cao, Yuanzhi Li +1
SeedFold: Scaling Biomolecular Structure Prediction
Yi Zhou, Chan Lu, Yiming Ma +6
Variance-Dependent Regret Bounds for Linear Bandits and Reinforcement Learning: Adaptivity and Computational Efficiency
Heyang Zhao, Jiafan He, Dongruo Zhou +2
MARS-M: When Variance Reduction Meets Matrices
Yifeng Liu, Angela Yuan, Quanquan Gu
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
Linxi Zhao, Yihe Deng, Weitong Zhang +1
Optimization Theory for ReLU Neural Networks Trained with Normalization Layers
Yonatan Dukler, Quanquan Gu, Guido Montúfar
An All-Atom Generative Model for Designing Protein Complexes
Ruizhe Chen, Dongyu Xue, Xiangxin Zhou +3
Learning Stochastic Shortest Path with Linear Function Approximation
Yifei Min, Jiafan He, Tianhao Wang +1
Towards Faster Rates and Oracle Property for Low-Rank Matrix Estimation
Huan Gui, Quanquan Gu
Exploring Architectural Ingredients of Adversarially Robust Deep Neural Networks
Hanxun Huang, Yisen Wang, Sarah Monazam Erfani +3
Antigen-Specific Antibody Design via Direct Energy-based Preference Optimization
Xiangxin Zhou, Dongyu Xue, Ruizhe Chen +3
Benign Overfitting for Two-layer ReLU Convolutional Neural Networks
Yiwen Kou, Zixiang Chen, Yuanzhou Chen +1
TrustLLM: Trustworthiness in Large Language Models
Yue Huang, Lichao Sun, Haoran Wang +67
Protein Autoregressive Modeling via Multiscale Structure Generation
Yanru Qu, Cheng-Yen Hsieh, Zaixiang Zheng +2
Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
Kaixuan Ji, Qingyue Zhao, Heyang Zhao +2
Nearly Optimal Algorithms for Contextual Dueling Bandits from Adversarial Feedback
Qiwei Di, Jiafan He, Quanquan Gu
Towards Simple and Provable Parameter-Free Adaptive Gradient Methods
Yuanzhe Tao, Yifeng Liu, Huizhuo Yuan +3
DPLM-2: A Multimodal Diffusion Protein Language Model
Xinyou Wang, Zaixiang Zheng, Fei Ye +3
Benign Overfitting in Two-layer Convolutional Neural Networks
Yuan Cao, Zixiang Chen, Mikhail Belkin +1
Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models
Chenyang Zhang, Qingyue Zhao, Quanquan Gu +1
On the Convergence of Certified Robust Training with Interval Bound Propagation
Yihan Wang, Zhouxing Shi, Quanquan Gu +1
RSPO: Regularized Self-Play Alignment of Large Language Models
Xiaohang Tang, Sangwoong Yoon, Seongho Son +3
Unlocking Feature Learning in Gated Delta Networks at Scale
Yifeng Liu, Quanquan Gu
Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization
Kaixuan Ji, Guanlin Liu, Ning Dai +6
A Universal Variance Reduction-Based Catalyst for Nonconvex Low-Rank Matrix Recovery
Lingxiao Wang, Xiao Zhang, Quanquan Gu
Adaptive Differentially Private Empirical Risk Minimization
Xiaoxia Wu, Lingxiao Wang, Irina Cristali +2
PrivacyMind: Large Language Models Can Be Contextual Privacy Protection Learners
Yijia Xiao, Yiqiao Jin, Yushi Bai +10
On the Interplay Between Misspecification and Sub-optimality Gap in Linear Contextual Bandits
Weitong Zhang, Jiafan He, Zhiyuan Fan +1
Neural Contextual Bandits with UCB-based Exploration
Dongruo Zhou, Lihong Li, Quanquan Gu
Computationally Efficient Horizon-Free Reinforcement Learning for Linear Mixture MDPs
Dongruo Zhou, Quanquan Gu
Self-training Converts Weak Learners to Strong Learners in Mixture Models
Spencer Frei, Difan Zou, Zixiang Chen +1
Third-order Smoothness Helps: Even Faster Stochastic Optimization Algorithms for Finding Local Minima
Yaodong Yu, Pan Xu, Quanquan Gu
Designing Cyclic Peptides via Harmonic SDE with Atom-Bond Modeling
Xiangxin Zhou, Mingyu Li, Yi Xiao +5
Neural Thompson Sampling
Weitong Zhang, Dongruo Zhou, Lihong Li +1
Faster Convergence of Stochastic Gradient Langevin Dynamics for Non-Log-Concave Sampling
Difan Zou, Pan Xu, Quanquan Gu
RayS: A Ray Searching Method for Hard-label Adversarial Attack
Jinghui Chen, Quanquan Gu
Towards Understanding the Spectral Bias of Deep Learning
Yuan Cao, Zhiying Fang, Yue Wu +2
Batched Neural Bandits
Quanquan Gu, Amin Karbasi, Khashayar Khosravi +2
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
Yifan Zhang, Ge Zhang, Yue Wu +2
The Benefits of Implicit Regularization from SGD in Least Squares Problems
Difan Zou, Jingfeng Wu, Vladimir Braverman +3
On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
Kaixuan Ji, Qiwei Di, Heyang Zhao +2
Provably Efficient Reinforcement Learning for Discounted MDPs with Feature Mapping
Dongruo Zhou, Jiafan He, Quanquan Gu
Achieving Constant Regret in Linear Markov Decision Processes
Weitong Zhang, Zhiyuan Fan, Jiafan He +1
Best-of-Majority: Minimax-Optimal Strategy for Pass@ Inference Scaling
Qiwei Di, Kaixuan Ji, Xuheng Li +2
Towards Understanding Mixture of Experts in Deep Learning
Zixiang Chen, Yihe Deng, Yue Wu +2
Learning Neural Contextual Bandits Through Perturbed Rewards
Yiling Jia, Weitong Zhang, Dongruo Zhou +2
Finite-Sample Analysis of Learning High-Dimensional Single ReLU Neuron
Jingfeng Wu, Difan Zou, Zixiang Chen +3
Statistical Limits of Convex Relaxations
Zhaoran Wang, Quanquan Gu, Han Liu
Faster Perturbed Stochastic Gradient Methods for Finding Local Minima
Zixiang Chen, Dongruo Zhou, Quanquan Gu
Double Explore-then-Commit: Asymptotic Optimality and Beyond
Tianyuan Jin, Pan Xu, Xiaokui Xiao +1
Dimension-Independent Convergence of Underdamped Langevin Monte Carlo in KL Divergence
Shiyuan Zhang, Qiwei Di, Xuheng Li +1
LLaVA-Critic: Learning to Evaluate Multimodal Models
Tianyi Xiong, Xiyao Wang, Dong Guo +5
Variance-Dependent Regret Lower Bounds for Contextual Bandits
Jiafan He, Quanquan Gu
Nearly Minimax Optimal Reinforcement Learning for Discounted MDPs
Jiafan He, Dongruo Zhou, Quanquan Gu
Global Convergence of Langevin Dynamics Based Algorithms for Nonconvex Optimization
Pan Xu, Jinghui Chen, Difan Zou +1
Protein Conformation Generation via Force-Guided SE(3) Diffusion Models
Yan Wang, Lihao Wang, Yuning Shen +4
Closing the Generalization Gap of Adaptive Gradient Methods in Training Deep Neural Networks
Jinghui Chen, Dongruo Zhou, Yiqi Tang +3
How Many Pretraining Tasks Are Needed for In-Context Learning of Linear Regression?
Jingfeng Wu, Difan Zou, Zixiang Chen +3
MARS: Unleashing the Power of Variance Reduction for Training Large Models
Huizhuo Yuan, Yifeng Liu, Shuang Wu +2
Scalable Spatio-Temporal SE(3) Diffusion for Long-Horizon Protein Dynamics
Nima Shoghi, Yuxuan Liu, Yuning Shen +3
Stochastic Variance-Reduced Cubic Regularized Newton Method
Dongruo Zhou, Pan Xu, Quanquan Gu
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
Zixiang Chen, Yihe Deng, Huizhuo Yuan +2
Provably Efficient Reinforcement Learning with Linear Function Approximation Under Adaptivity Constraints
Tianhao Wang, Dongruo Zhou, Quanquan Gu
Towards a Sharp Analysis of Offline Policy Learning for -Divergence-Regularized Contextual Bandits
Qingyue Zhao, Kaixuan Ji, Heyang Zhao +2
SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving
Wendong Xu, Jing Xiong, Chenyang Zhao +16