Publications (98)
Reliable and Responsible Foundation Models: A Comprehensive Survey
Xinyu Yang, Junlin Han, Rishi Bommasani +49
F-FOMAML: GNN-Enhanced Meta-Learning for Peak Period Demand Forecasting with Proxy Data
Zexing Xu, Linjun Zhang, Sitan Yang +4
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
Peng Xia, Kangyu Zhu, Haoran Li +6
Double Cross Validation for the Number of Factors in Approximate Factor Models
Xianli Zeng, Yingcun Xia, Linjun Zhang
Evaluating LLMs When They Do Not Know the Answer: Statistical Evaluation of Mathematical Reasoning via Comparative Signals
Zihan Dong, Zhixian Zhang, Yang Zhou +3
Can AI Be as Creative as Humans?
Haonan Wang, James Zou, Michael Mozer +8
Synthetic Oversampling: Theory and A Practical Approach Using LLMs to Address Data Imbalance
Ryumei Nakada, Yichen Xu, Lexin Li +1
RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models
Peng Xia, Kangyu Zhu, Haoran Li +5
When and How Mixup Improves Calibration
Linjun Zhang, Zhun Deng, Kenji Kawaguchi +1
Evidence Over Plans: Online Trajectory Verification for Skill Distillation
Yang Zhou, Zihan Dong, Zhenting Wang +7
The Power of Contrast for Feature Learning: A Theoretical Analysis
Wenlong Ji, Zhun Deng, Ryumei Nakada +2
Differentially Private Federated Learning: Servers Trustworthiness, Estimation, and Statistical Inference
Zhe Zhang, Ryumei Nakada, Linjun Zhang
FactTest: Factuality Testing in Large Language Models with Finite-Sample and Distribution-Free Guarantees
Fan Nie, Xiaotian Hou, Shuhang Lin +3
Secret-Protected Evolution for Differentially Private Synthetic Text Generation
Tianze Wang, Zhaoyu Chen, Jian Du +3
Conformal Prediction for Deep Classifier via Label Ranking
Jianguo Huang, Huajun Xi, Linjun Zhang +3
Safeguarding Data in Multimodal AI: A Differentially Private Approach to CLIP Training
Alyssa Huang, Peihan Liu, Ryumei Nakada +2
Efficient machine unlearning with minimax optimality
Jingyi Xie, Linjun Zhang, Sai Li
A Theoretical Framework for Prompt Engineering: Approximating Smooth Functions with Transformer Prompts
Ryumei Nakada, Wenlong Ji, Tianxi Cai +2
C-Mixup: Improving Generalization in Regression
Huaxiu Yao, Yiping Wang, Linjun Zhang +2
How Does Mixup Help With Robustness and Generalization?
Linjun Zhang, Zhun Deng, Kenji Kawaguchi +2
Freeze then Train: Towards Provable Representation Learning under Spurious Correlations and Feature Noise
Haotian Ye, James Zou, Linjun Zhang
AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration
Jiaqi Liu, Shi Qiu, Mairui Li +33
Bias-Corrected Data Synthesis for Imbalanced Learning
Pengfei Lyu, Zhengchi Ma, Linjun Zhang +1
Statistical Inference for Differentially Private Stochastic Gradient Descent
Xintao Xia, Linjun Zhang, Zhanrui Cai
HappyMap: A Generalized Multi-calibration Method
Zhun Deng, Cynthia Dwork, Linjun Zhang
A Central Limit Theorem for Differentially Private Query Answering
Jinshuo Dong, Weijie J. Su, Linjun Zhang
PEANuT: Parameter-Efficient Adaptation with Weight-aware Neural Tweakers
Yibo Zhong, Haoxiang Jiang, Lincan Li +5
Labels or Preferences? Budget-Constrained Learning with Human Judgments over AI-Generated Outputs
Zihan Dong, Xiaotian Hou, Ruijia Wu +1
Interpreting Robust Optimization via Adversarial Influence Functions
Zhun Deng, Cynthia Dwork, Jialiang Wang +1
PieArena: Ranking and Profiling Language Agents in Realistic Negotiation Scenarios
Chris Zhu, Sasha Cui, Will Sanok Dufallo +4
Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising
Tianci Liu, Zihan Dong, Linjun Zhang +5
Discover and Cure: Concept-aware Mitigation of Spurious Correlation
Shirley Wu, Mert Yuksekgonul, Linjun Zhang +1
Selective Learning: Towards Robust Calibration with Dynamic Regularization
Zongbo Han, Yifeng Yang, Changqing Zhang +3
Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing
Tianci Liu, Ruirui Li, Zihan Dong +6
Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
Siwei Han, Kaiwen Xiong, Jiaqi Liu +9
The Cost of Privacy: Optimal Rates of Convergence for Parameter Estimation with Differential Privacy
T. Tony Cai, Yichen Wang, Linjun Zhang
RoseRAG: Robust Retrieval-augmented Generation with Small-scale LLMs via Margin-aware Preference Optimization
Tianci Liu, Haoxiang Jiang, Tianze Wang +5
Scaffolding Sets
Maya Burhanpurkar, Zhun Deng, Cynthia Dwork +1
Estimation, Confidence Intervals, and Large-Scale Hypotheses Testing for High-Dimensional Mixed Linear Regression
Linjun Zhang, Rong Ma, T. Tony Cai +1
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
Ran Xu, Tianci Liu, Zihan Dong +6
FaiREE: Fair Classification with Finite-Sample and Distribution-Free Guarantee
Puheng Li, James Zou, Linjun Zhang
Differentially Private Estimation and Inference in High-Dimensional Regression with FDR Control
Zhanrui Cai, Sai Li, Xintao Xia +1
An Overview of Large Language Models for Statisticians
Wenlong Ji, Weizhe Yuan, Emily Getzen +7
Distribution-Free Fair Federated Learning with Small Samples
Qichuan Yin, Zexian Wang, Junzhou Huang +2
Differentially Private Verification of Distribution Properties
Elbert Du, Cynthia Dwork, Pranay Tankala +1
UQ: Assessing Language Models on Unsolved Questions
Fan Nie, Ken Ziyu Liu, Zihao Wang +11
MPO: An Efficient Post-Processing Framework for Mixing Diverse Preference Alignment
Tianze Wang, Dongnan Gui, Yifan Hu +2
Improving Adversarial Robustness via Unlabeled Out-of-Domain Data
Zhun Deng, Linjun Zhang, Amirata Ghorbani +1
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
Huiying Zhong, Zhun Deng, Weijie J. Su +2
Personalizing black-box models for nonparametric regression with minimax optimality
Sai Li, Linjun Zhang
What Should Data Science Education Do with Large Language Models?
Xinming Tu, James Zou, Weijie J. Su +1
Multi-dimensional domain generalization with low-rank structures
Sai Li, Linjun Zhang
The Cost of Privacy in Generalized Linear Models: Algorithms and Minimax Lower Bounds
T. Tony Cai, Yichen Wang, Linjun Zhang
Order-Independence Without Fine Tuning
Reid McIlroy-Young, Katrina Brown, Conlan Olson +2
A Statistical Framework for Alignment with Biased AI Feedback
Xintao Xia, Zhiqiu Xia, Linjun Zhang +1
Exactly scale-free scale-free networks
Linjun Zhang, Michael Small, Kevin Judd
Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards
Shirley Wu, Parth Sarthi, Shiyu Zhao +10
FAIRM: Learning invariant representations for algorithmic fairness and domain generalization with minimax optimality
Sai Li, Linjun Zhang
Improving Out-of-Distribution Robustness via Selective Augmentation
Huaxiu Yao, Yu Wang, Sai Li +4
Improving Generalization in Meta-learning via Task Augmentation
Huaxiu Yao, Longkai Huang, Linjun Zhang +5
Fair Risk Control: A Generalized Framework for Calibrating Multi-group Fairness Risks
Lujing Zhang, Aaron Roth, Linjun Zhang
Operationalizing Individual Fairness via Gradient Descent and Bradley-Terry Models
Conlan Olson, Linjun Zhang, Zhun Deng +1
Beyond Confidence: Reliable Models Should Also Consider Atypicality
Mert Yuksekgonul, Linjun Zhang, James Zou +1
S$^{2}$FT: Efficient, Scalable and Generalizable LLM Fine-tuning by Structured Sparsity
Xinyu Yang, Jixuan Leng, Geyang Guo +5
Contrastive Learning on Multimodal Analysis of Electronic Health Records
Tianxi Cai, Feiqing Huang, Ryumei Nakada +2
AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
Ran Xu, Yuchen Zhuang, Zihan Dong +7
Residual Feature Integration is Sufficient to Prevent Negative Transfer
Yichen Xu, Ryumei Nakada, Linjun Zhang +1
Reinforcement Learning with Stepwise Fairness Constraints
Zhun Deng, He Sun, Zhiwei Steven Wu +2
Contrastive Network Representation Learning
Zihan Dong, Xin Zhou, Ryumei Nakada +2
FIFA: Making Fairness More Generalizable in Classifiers Trained on Imbalanced Data
Zhun Deng, Jiayao Zhang, Linjun Zhang +4
To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis
Federico Bianchi, Yongchan Kwon, Zachary Izzo +2
Differentially Private Learning Beyond the Classical Dimensionality Regime
Cynthia Dwork, Pranay Tankala, Linjun Zhang
Understanding Dynamics of Nonlinear Representation Learning and Its Application
Kenji Kawaguchi, Linjun Zhang, Zhun Deng
Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges
Chenhang Cui, Yiyang Zhou, Xinyu Yang +4
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
Haoxiang Jiang, Zihan Dong, Tianci Liu +5
Adversarial Training Helps Transfer Learning via Better Representations
Zhun Deng, Linjun Zhang, Kailas Vodrahalli +2
RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation
Pei Tian, Zihan Dong, Tianci Liu +2
Finite-Sample and Distribution-Free Fair Classification: Optimal Trade-off Between Excess Risk and Fairness, and the Cost of Group-Blindness
Xiaotian Hou, Linjun Zhang
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
Peng Xia, Jinglu Wang, Yibo Peng +10
Calibrated Self-Rewarding Vision Language Models
Yiyang Zhou, Zhiyuan Fan, Dongjie Cheng +7
A Unified Combination Framework for Dependent Tests with Applications to Microbiome Association Studies
Xiufan Yu, Linjun Zhang, Arun Srinivasan +2
High-Dimensional Differentially-Private EM Algorithm: Methods and Near-Optimal Statistical Guarantees
Zhe Zhang, Linjun Zhang
Score Attack: A Lower Bound Technique for Optimal Differentially Private Learning
T. Tony Cai, Yichen Wang, Linjun Zhang
Repro Samples Method for Model-Free Inference in High-Dimensional Binary Classification
Xiaotian Hou, Peng Wang, Minge Xie +1
Repro Samples Method for High-dimensional Logistic Model
Xiaotian Hou, Linjun Zhang, Peng Wang +1
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
Yiyang Zhou, Chenhang Cui, Jaehong Yoon +5
A Statistical Hypothesis Testing Framework for Data Misappropriation Detection in Large Language Models
Yinpeng Cai, Lexin Li, Linjun Zhang
A Sparse PCA Approach to Clustering
T. Tony Cai, Linjun Zhang
Differentially Private Sliced Inverse Regression: Minimax Optimality and Algorithm
Xintao Xia, Linjun Zhang, Zhanrui Cai
High-Dimensional Gaussian Copula Regression: Adaptive Estimation and Statistical Inference
T. Tony Cai, Linjun Zhang
High-dimensional Linear Discriminant Analysis: Optimality, Adaptive Algorithm, and Missing Data
T. Tony Cai, Linjun Zhang
Unified Inference Framework for Single and Multi-Player Performative Prediction: Method and Asymptotic Optimality
Zhixian Zhang, Xiaotian Hou, Linjun Zhang
A Lightweight Algorithm to Uncover Deep Relationships in Data Tables
Jin Cao, Yibo Zhao, Linjun Zhang +1
A Convex Optimization Approach to High-Dimensional Sparse Quadratic Discriminant Analysis
T. Tony Cai, Linjun Zhang
Equitable Evaluation via Elicitation
Elbert Du, Cynthia Dwork, Lunjia Hu +3
Understanding Multimodal Contrastive Learning and Incorporating Unpaired Data
Ryumei Nakada, Halil Ibrahim Gulluk, Zhun Deng +3
Finite- and Large- Sample Inference for Model and Coefficients in High-dimensional Linear Regression with Repro Samples
Peng Wang, Min-Ge Xie, Linjun Zhang
Meta-Learning with Fewer Tasks through Task Interpolation
Huaxiu Yao, Linjun Zhang, Chelsea Finn