Publications (318)
OpenDataVal: a Unified Benchmark for Data Valuation
Kevin Fu Jiang, Weixin Liang, James Zou +1
Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment
Sheng Liu, Long Chen, Zeyun Zhao +16
MetaShift: A Dataset of Datasets for Evaluating Contextual Distribution Shifts and Training Conflicts
Weixin Liang, James Zou
Data-Driven Subgroup Identification for Linear Regression
Zachary Izzo, Ruishan Liu, James Zou
Unlocking LLM Creativity in Science through Analogical Reasoning
Andrew Shen, Shaul Druckmann, James Zou
Signal to noise in matching markets
S. Matthew Weinberg, James Zou
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
Yiyang Zhou, Haoqin Tu, Zijun Wang +11
Last-Layer Fairness Fine-tuning is Simple and Effective for Neural Networks
Yuzhen Mao, Zhun Deng, Huaxiu Yao +3
Mind the Gap: Understanding the Modality Gap in Multi-modal Contrastive Representation Learning
Weixin Liang, Yuhui Zhang, Yongchan Kwon +2
CloudPred: Predicting Patient Phenotypes From Single-cell RNA-seq
Bryan He, Matthew Thomson, Meena Subramaniam +3
C-Mixup: Improving Generalization in Regression
Huaxiu Yao, Yiping Wang, Linjun Zhang +2
Freeze then Train: Towards Provable Representation Learning under Spurious Correlations and Feature Noise
Haotian Ye, James Zou, Linjun Zhang
Simple linear attention language models balance the recall-throughput tradeoff
Simran Arora, Sabri Eyuboglu, Michael Zhang +6
AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration
Jiaqi Liu, Shi Qiu, Mairui Li +33
Optimizing Model Selection for Compound AI Systems
Lingjiao Chen, Jared Quincy Davis, Boris Hanin +4
Data Diversification Methods In Alignment Enhance Math Performance In LLMs
Berkan Dokmeci, Qingyang Wu, Ben Athiwaratkun +3
Approximate Data Deletion from Machine Learning Models
Zachary Izzo, Mary Anne Smart, Kamalika Chaudhuri +1
Development and Clinical Evaluation of an AI Support Tool for Improving Telemedicine Photo Quality
Kailas Vodrahalli, Justin Ko, Albert S. Chiou +7
Latent Collaboration in Multi-Agent Systems
Jiaru Zou, Ruizhong Qiu, Gaotang Li +10
Discover and Cure: Concept-aware Mitigation of Spurious Correlation
Shirley Wu, Mert Yuksekgonul, Linjun Zhang +1
Disparities in Dermatology AI Performance on a Diverse, Curated Clinical Image Set
Roxana Daneshjou, Kailas Vodrahalli, Roberto A Novoa +16
Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents
Muyu He, Anand Kumar, Tsach Mackey +3
Solving Inequality Proofs with Large Language Models
Pan Lu, Jiayi Sheng, Luna Lyu +4
Cartridges: Lightweight and general-purpose long context representations via self-study
Sabri Eyuboglu, Ryan Ehrlich, Simran Arora +8
Navigating Dataset Documentations in AI: A Large-Scale Analysis of Dataset Cards on Hugging Face
Xinyu Yang, Weixin Liang, James Zou
Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
Lingjiao Chen, Jared Quincy Davis, Boris Hanin +4
Is your data alignable? Principled and interpretable alignability testing and integration of single-cell data
Rong Ma, Eric D. Sun, David Donoho +1
Can Small Training Runs Reliably Guide Data Curation? Rethinking Proxy-Model Practice
Jiachen T. Wang, Tong Wu, Kaifeng Lyu +4
Knockoffs for the mass: new feature importance statistics with false discovery guarantees
Jaime Roquero Gimenez, Amirata Ghorbani, James Zou
Real-Time Voice AI Hears but Does Not Listen
Martijn Bartelds, Federico Bianchi, James Zou
Generating readily synthesizable small molecule fluorophore scaffolds with reinforcement learning
Ruhi Sayana, Kate Callon, Jennifer Xu +6
ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning
Yongchan Kwon, Shang Zhu, Federico Bianchi +2
What Should Data Science Education Do with Large Language Models?
Xinming Tu, James Zou, Weijie J. Su +1
GSCLIP : A Framework for Explaining Distribution Shifts in Natural Language
Zhiying Zhu, Weixin Liang, James Zou
ClashEval: Quantifying the tug-of-war between an LLM's internal prior and external evidence
Kevin Wu, Eric Wu, James Zou
Automated radiotherapy treatment planning guided by GPT-4Vision
Sheng Liu, Oscar Pastor-Serrano, Yizheng Chen +10
CollabLLM: From Passive Responders to Active Collaborators
Shirley Wu, Michel Galley, Baolin Peng +7
Improving Out-of-Distribution Robustness via Selective Augmentation
Huaxiu Yao, Yu Wang, Sai Li +4
Domino: Discovering Systematic Errors with Cross-Modal Embeddings
Sabri Eyuboglu, Maya Varma, Khaled Saab +5
Stochastic EM for Shuffled Linear Regression
Abubakar Abid, James Zou
When and why vision-language models behave like bags-of-words, and what to do about it?
Mert Yuksekgonul, Federico Bianchi, Pratyusha Kalluri +2
ExGra-Med: Extended Context Graph Alignment for Medical Vision-Language Models
Duy M. H. Nguyen, Nghiem T. Diep, Trung Q. Nguyen +10
How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?
Rahul Thapa, Andrew Li, Qingyang Wu +8
Can LLM feedback enhance review quality? A randomized study of 20K reviews at ICLR 2025
Nitya Thakkar, Mert Yuksekgonul, Jake Silberg +6
Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration
Sukwon Yun, Jie Peng, Pingzhi Li +5
Analyzing Polarization in Social Media: Method and Application to Tweets on 21 Mass Shootings
Dorottya Demszky, Nikhil Garg, Rob Voigt +4
Contrastive Variational Autoencoder Enhances Salient Features
Abubakar Abid, James Zou
OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
Pan Lu, Bowen Chen, Sheng Liu +3
Efficient and Asymptotically Unbiased Constrained Decoding for Large Language Models
Haotian Ye, Himanshu Jain, Chong You +4
Beyond Bilingual: Multi-sense Word Embeddings using Multilingual Context
Shyam Upadhyay, Kai-Wei Chang, Matt Taddy +2
Exploring the use of AI authors and reviewers at Agents4Science
Federico Bianchi, Owen Queen, Nitya Thakkar +2
Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think
Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha +18
A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization
Tianyu Liu, Wangjie Zheng, Rui Yang +12
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
Hanchen Li, Runyuan He, Qizheng Zhang +11
Competing AI: How does competition feedback affect machine learning?
Antonio Ginart, Eva Zhang, Yongchan Kwon +1
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
Jiaru Zou, Soumya Roy, Vinay Kumar Verma +6
Explaining medical AI performance disparities across sites with confounder Shapley value analysis
Eric Wu, Kevin Wu, James Zou
What LLMs Think When You Don't Tell Them What to Think About?
Yongchan Kwon, James Zou
Cost-of-Pass: An Economic Framework for Evaluating Language Models
Mehmet Hamza Erol, Batu El, Mirac Suzgun +2
Learning to Discover at Test Time
Mert Yuksekgonul, Daniel Koceja, Xinhao Li +8
A Survey on Data Markets
Jiayao Zhang, Yuran Bi, Mengye Cheng +15
Advancing AI Research Assistants with Expert-Involved Learning
Tianyu Liu, Simeng Han, Hanchen Wang +27
Diagnosing and Rectifying Vision Models using Language
Yuhui Zhang, Jeff Z. HaoChen, Shih-Cheng Huang +3
GPT detectors are biased against non-native English writers
Weixin Liang, Mert Yuksekgonul, Yining Mao +2
The Agentic Garden of Forking Paths
Jiacheng Miao, Jonathan K Pritchard, James Zou
Data Shapley: Equitable Valuation of Data for Machine Learning
Amirata Ghorbani, James Zou
4KAgent: Agentic Any Image to 4K Super-Resolution
Yushen Zuo, Qi Zheng, Mingyang Wu +10
GraphMETRO: Mitigating Complex Graph Distribution Shifts via Mixture of Aligned Experts
Shirley Wu, Kaidi Cao, Bruno Ribeiro +2
Efficient computation and analysis of distributional Shapley values
Yongchan Kwon, Manuel A. Rivas, James Zou
AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
Kunlun Zhu, Xuyan Ye, Zhiguang Han +9
STaRK: Benchmarking LLM Retrieval on Textual and Relational Knowledge Bases
Shirley Wu, Shiyu Zhao, Michihiro Yasunaga +7
MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences
Eric Wu, Kevin Wu, Jason Hom +11
SMIR: Efficient Synthetic Data Pipeline To Improve Multi-Image Reasoning
Andrew Li, Rahul Thapa, Rahul Chalamala +3
Data Budgeting for Machine Learning
Xinyi Zhao, Weixin Liang, James Zou
Interpretation of Neural Networks is Fragile
Amirata Ghorbani, Abubakar Abid, James Zou
How well do LLMs cite relevant medical references? An evaluation framework and analyses
Kevin Wu, Eric Wu, Ally Cassasola +7
DataPerf: Benchmarks for Data-Centric AI Development
Mark Mazumder, Colby Banbury, Xiaozhe Yao +42
Clustering Plotted Data by Image Segmentation
Tarek Naous, Srinjay Sarkar, Abubakar Abid +1
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
Peng Xia, Kangyu Zhu, Haoran Li +6
Recursive Multi-Agent Systems
Jiaru Zou, Rui Pan, Ruizhong Qiu +8
The paper proposes RecursiveMAS, a framework that treats a multi-agent system as a recursive latent‑space computation, enabling agents to iteratively refine each other's thoughts a…
Can AI Be as Creative as Humans?
Haonan Wang, James Zou, Michael Mozer +8
Minimizing Close-k Aggregate Loss Improves Classification
Bryan He, James Zou
A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning
Yuzheng Hu, Fan Wu, Haotian Ye +5
The Power of Contrast for Feature Learning: A Theoretical Analysis
Wenlong Ji, Zhun Deng, Ryumei Nakada +2
NeuralFDR: Learning Discovery Thresholds from Hypothesis Features
Fei Xia, Martin J. Zhang, James Zou +1
A Theoretical Framework for Prompt Engineering: Approximating Smooth Functions with Transformer Prompts
Ryumei Nakada, Wenlong Ji, Tianxi Cai +2
HAPI: A Large-scale Longitudinal Dataset of Commercial ML API Predictions
Lingjiao Chen, Zhihua Jin, Sabri Eyuboglu +3
On the Relationship Between Activation Outliers and Feature Death in Sparse Autoencoders
Elana Simon, Etowah Adams, James Zou
TrueImage: A Machine Learning Algorithm to Improve the Quality of Telehealth Photos
Kailas Vodrahalli, Roxana Daneshjou, Roberto A Novoa +3
Generative Evaluation of Complex Reasoning in Large Language Models
Haowei Lin, Xiangyu Wang, Ruilin Yan +7
How Does Mixup Help With Robustness and Generalization?
Linjun Zhang, Zhun Deng, Kenji Kawaguchi +2
Disentangling Reasoning and Knowledge in Medical Large Language Models
Rahul Thapa, Qingyang Wu, Kevin Wu +11
Persistent Anti-Muslim Bias in Large Language Models
Abubakar Abid, Maheen Farooqi, James Zou
Learning a Canonical Basis of Human Preferences from Binary Ratings
Kailas Vodrahalli, Wei Wei, James Zou
New Evaluation Metrics Capture Quality Degradation due to LLM Watermarking
Karanpartap Singh, James Zou
Beyond Importance Scores: Interpreting Tabular ML by Visualizing Feature Semantics
Amirata Ghorbani, Dina Berenbaum, Maor Ivgi +2
Capturing the Temporal Dependence of Training Data Influence
Jiachen T. Wang, Dawn Song, James Zou +2
A Unified f-divergence Framework Generalizing VAE and GAN
Jaime Roquero Gimenez, James Zou
AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
Andy Zhou, Kevin Wu, Francesco Pinto +7
Reliable and Responsible Foundation Models: A Comprehensive Survey
Xinyu Yang, Junlin Han, Rishi Bommasani +49