Publications (264)
Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP
Jinghan Wang, Mengdi Wang, Lin F. Yang
NoWag: A Unified Framework for Shape Preserving Compression of Large Language Models
Lawrence Liu, Inesh Chakrabarti, Yixiao Li +3
Communication Efficient Distributed Learning for Kernelized Contextual Bandits
Chuanhao Li, Huazheng Wang, Mengdi Wang +1
Generalization Bounds for Stochastic Saddle Point Problems
Junyu Zhang, Mingyi Hong, Mengdi Wang +1
Lower Bound On the Computational Complexity of Discounted Markov Decision Problems
Yichen Chen, Mengdi Wang
Science Earth: Towards A Planet-Scale Operating System for AI-Native Scientific Discovery
Zhe Zhao, Haibin Wen, Yingcheng Wu +10
Scalable Normalizing Flows Enable Boltzmann Generators for Macromolecules
Joseph C. Kim, David Bloore, Karan Kapoor +3
Learning Markov models via low-rank optimization
Ziwei Zhu, Xudong Li, Mengdi Wang +1
Is Inverse Reinforcement Learning Harder than Standard Reinforcement Learning? A Theoretical Perspective
Lei Zhao, Mengdi Wang, Yu Bai
Improved Sample Complexity for Stochastic Compositional Variance Reduced Gradient
Tianyi Lin, Chenyou Fan, Mengdi Wang +1
CUIfy the XR: An Open-Source Package to Embed LLM-powered Conversational Agents in XR
Kadir Burak Buldu, Süleyman Ãzdel, Ka Hei Carrie Lau +6
ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement Learning
Zhirong Chen, Kaiyan Chang, Zhuolin Li +8
Preacher: Paper-to-Video Agentic System
Jingwei Liu, Ling Yang, Hao Luo +3
Graph-Adaptive Pruning for Efficient Inference of Convolutional Neural Networks
Mengdi Wang, Qing Zhang, Jun Yang +2
Diffusion Transformer Captures Spatial-Temporal Dependencies: A Theory for Gaussian Process Data
Hengyu Fu, Zehao Dou, Jiawei Guo +2
Nonparametric Classification on Low Dimensional Manifolds using Overparameterized Convolutional Residual Networks
Zixuan Zhang, Kaiqi Zhang, Minshuo Chen +4
State Aggregation Learning from Markov Transition Data
Yaqi Duan, Zheng Tracy Ke, Mengdi Wang
Representation Learning for General-sum Low-rank Markov Games
Chengzhuo Ni, Yuda Song, Xuezhou Zhang +2
Sample Complexity of Preference-Based Nonparametric Off-Policy Evaluation with Deep Networks
Zihao Li, Xiang Ji, Minshuo Chen +1
Provable Benefits of Representational Transfer in Reinforcement Learning
Alekh Agarwal, Yuda Song, Wen Sun +3
Towards Understanding Text Hallucination of Diffusion Models via Local Generation Bias
Rui Lu, Runzhe Wang, Kaifeng Lyu +3
Latent Collaboration in Multi-Agent Systems
Jiaru Zou, Ruizhong Qiu, Gaotang Li +10
Improved Oracle Complexity of Variance Reduced Methods for Nonsmooth Convex Stochastic Composition Optimization
Tianyi Lin, Chenyou Fan, Mengdi Wang
Fast Best-of-N Decoding via Speculative Rejection
Hanshi Sun, Momin Haider, Ruiqi Zhang +6
MARL with General Utilities via Decentralized Shadow Reward Actor-Critic
Junyu Zhang, Amrit Singh Bedi, Mengdi Wang +1
FoldMark: Protecting Protein Generative Models with Watermarking
Zaixi Zhang, Ruofan Jin, Kaidi Fu +3
Towards Compact CNNs via Collaborative Compression
Yuchao Li, Shaohui Lin, Jianzhuang Liu +7
Offline Stochastic Shortest Path: Learning, Evaluation and Towards Optimality
Ming Yin, Wenjing Chen, Mengdi Wang +1
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
Minghao Guo, Qingyue Jiao, Zeru Shi +14
Byzantine-Robust Online and Offline Distributed Reinforcement Learning
Yiding Chen, Xuezhou Zhang, Kaiqing Zhang +2
Model-Based Reinforcement Learning with Value-Targeted Regression
Alex Ayoub, Zeyu Jia, Csaba Szepesvari +2
Contrastive Multi-document Question Generation
Woon Sang Cho, Yizhe Zhang, Sudha Rao +5
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations
Huan-ang Gao, Zikang Zhang, Tianwei Luo +9
Thin-Film Smoothed Particle Hydrodynamics Fluid
Mengdi Wang, Yitong Deng, Xiangxin Kong +3
Generalized Leverage Score Sampling for Neural Networks
Jason D. Lee, Ruoqi Shen, Zhao Song +2
Temporal Consistency for LLM Reasoning Process Error Identification
Jiacheng Guo, Yue Wu, Jiahao Qiu +4
Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts
Aiden Yiliu Li, Xinyue Hao, Shilong Liu +1
Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding
Zhiyuan Jiang, Shenghao Xie, Wenyi Li +8
MaxMin-RLHF: Alignment with Diverse Human Preferences
Souradip Chakraborty, Jiahao Qiu, Hui Yuan +5
Sparse Feature Selection Makes Batch Reinforcement Learning More Sample Efficient
Botao Hao, Yaqi Duan, Tor Lattimore +2
Variance Reduction Methods for Sublinear Reinforcement Learning
Sham Kakade, Mengdi Wang, Lin F. Yang
Be CIM or Be Memory: A Dual-mode-aware DNN Compiler for CIM Accelerators
Shixin Zhao, Yuming Li, Bing Li +4
An Interface Tracking Method with Triangle Edge Cuts
Mengdi Wang, Matthew Cong, Bo Zhu
A 5' UTR Language Model for Decoding Untranslated Regions of mRNA and Function Predictions
Yanyi Chu, Dan Yu, Yupeng Li +5
Multi-Level Stochastic Gradient Methods for Nested Composition Optimization
Shuoguang Yang, Mengdi Wang, Ethan X. Fang
Training-Free Guidance Beyond Differentiability: Scalable Path Steering with Tree Search in Diffusion and Flow Models
Yingqing Guo, Yukang Yang, Hui Yuan +1
Energy System Digitization in the Era of AI: A Three-Layered Approach towards Carbon Neutrality
Le Xie, Tong Huang, Xiangtian Zheng +6
Approximation Methods for Bilevel Programming
Saeed Ghadimi, Mengdi Wang
You Only Compress Once: Towards Effective and Elastic BERT Compression via Exploit-Explore Stochastic Nature Gradient
Shaokun Zhang, Xiawu Zheng, Chenyi Yang +7
Finite-sum Composition Optimization via Variance Reduced Gradient Descent
Xiangru Lian, Mengdi Wang, Ji Liu
Quantitative bounds in a popular polynomial Szemerédi theorem
Xuancheng Shao, Mengdi Wang
FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction
Zhiyuan Zeng, Jiashuo Liu, Siyuan Chen +28
Bandit Theory and Thompson Sampling-Guided Directed Evolution for Sequence Optimization
Hui Yuan, Chengzhuo Ni, Huazheng Wang +4
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
Kaixuan Huang, Jiacheng Guo, Zihao Li +15
OpenClaw-RL: Train Any Agent Simply by Talking
Yinjie Wang, Xuyang Chen, Xiaolong Jin +2
Spectral State Compression of Markov Processes
Anru Zhang, Mengdi Wang
Local divisor correlations in almost all short intervals
Javier Pliego, Yu-Chen Sun, Mengdi Wang
GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance
Zaixi Zhang, Zhenghong Zhou, Ruofan Jin +2
On Function Approximation in Reinforcement Learning: Optimism in the Face of Large State Spaces
Zhuoran Yang, Chi Jin, Zhaoran Wang +2
AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?
Zhangchen Xu, Junda Chen, Yue Huang +16
Higher-order Linear Attention
Yifan Zhang, Zhen Qin, Mengdi Wang +1
Sketching Transformed Matrices with Applications to Natural Language Processing
Yingyu Liang, Zhao Song, Mengdi Wang +2
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
Soumya Suvra Ghosal, Souradip Chakraborty, Avinash Reddy +6
Near-optimal Offline Reinforcement Learning with Linear Representation: Leveraging Variance Information with Pessimism
Ming Yin, Yaqi Duan, Mengdi Wang +1
Sample Complexity of Nonparametric Off-Policy Evaluation on Low-Dimensional Manifolds using Deep Networks
Xiang Ji, Minshuo Chen, Mengdi Wang +1
Data is all you need: Finetuning LLMs for Chip Design via an Automated design-data augmentation framework
Kaiyan Chang, Kun Wang, Nan Yang +16
Bootstrapping Fitted Q-Evaluation for Off-Policy Inference
Botao Hao, Xiang Ji, Yaqi Duan +3
Matrix-Free Multigrid with Algebraically Consistent Coarsening on Adaptive Octrees
Mengdi Wang, Yuchen Sun, Bo Zhu
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
Ling Yang, Zhaochen Yu, Bin Cui +1
Monte Carlo Tree Diffusion with Multiple Experts for Protein Design
Xuefeng Liu, Mingxuan Cao, Songhao Jiang +6
Web World Models
Jichen Feng, Yifan Zhang, Chenggong Zhang +3
An Overview of Diffusion Models: Applications, Guided Generation, Statistical Rates and Optimization
Minshuo Chen, Song Mei, Jianqing Fan +1
Make LLM Inference Affordable to Everyone: Augmenting GPU Memory with NDP-DIMM
Lian Liu, Shixin Zhao, Bing Li +6
Near-Optimal Stochastic Approximation for Online Principal Component Estimation
Chris Junchi Li, Mengdi Wang, Han Liu +1
Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning
Ming Yin, Yuanhao Qu, Ling Yang +2
ChipGPT: How far are we from natural language hardware design
Kaiyan Chang, Ying Wang, Haimeng Ren +5
EmoAgent: Assessing and Safeguarding Human-AI Interaction for Mental Health Safety
Jiahao Qiu, Yinghui He, Xinzhe Juan +7
Cautious Reinforcement Learning via Distributional Risk in the Dual Domain
Junyu Zhang, Amrit Singh Bedi, Mengdi Wang +1
Online Factorization and Partition of Complex Networks From Random Walks
Lin F. Yang, Vladimir Braverman, Tuo Zhao +1
Gradient Guidance for Diffusion Models: An Optimization Perspective
Yingqing Guo, Hui Yuan, Yukang Yang +2
Qumus: Realization of An Embodied AI Quantum Material Experimentalist
Lihan Shi, Zhaoyi Joy Zheng, Xinzhe Juan +14
Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
NVIDIA, :, Aakshita Chandiramani +544
Transfer Q Star: Principled Decoding for LLM Alignment
Souradip Chakraborty, Soumya Suvra Ghosal, Ming Yin +4
A Theoretical Perspective for Speculative Decoding Algorithm
Ming Yin, Minshuo Chen, Kaixuan Huang +1
Conversational Dueling Bandits in Generalized Linear Models
Shuhua Yang, Hui Yuan, Xiaoying Zhang +3
Double Duality: Variational Primal-Dual Policy Optimization for Constrained Reinforcement Learning
Zihao Li, Boyi Liu, Zhuoran Yang +2
Efficient Reinforcement Learning with Impaired Observability: Learning to Act with Delayed and Missing State Observations
Minshuo Chen, Jie Meng, Yu Bai +3
Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents
Haoran Zhang, Yifu Lu, Boyang Wang +5
IterComp: Iterative Composition-Aware Feedback Learning from Model Gallery for Text-to-Image Generation
Xinchen Zhang, Ling Yang, Guohao Li +6
Safeguarding Privacy: Privacy-Preserving Detection of Mind Wandering and Disengagement Using Federated Learning in Online Education
Anna Bodonhelyi, Mengdi Wang, Efe Bozkir +2
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
Lian Liu, Shixin Zhao, Yutian Zhou +4
DeepLoop: Depth Scaling for Looped Transformers
Shuzhen Li, Yifan Zhang, Jiacheng Guo +2
DeepLoop reuses a compact stack of transformer blocks across multiple passes to increase model depth without adding parameters, and introduces new residual scaling rules to keep tr…
Diffusion Model for Data-Driven Black-Box Optimization
Zihao Li, Hui Yuan, Kaixuan Huang +4
Parameter-Efficient Sparsity for Large Language Models Fine-Tuning
Yuchao Li, Fuli Luo, Chuanqi Tan +4
Quantitative asymptotics for polynomial patterns in the primes
Lilian Matthiesen, Joni Teräväinen, Mengdi Wang
Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-Evolution
Jiahao Qiu, Xuan Qi, Tongcheng Zhang +15
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
Shuhan Xue, Zixin Ding, Yichen Shen +6
Online Sparse Reinforcement Learning
Botao Hao, Tor Lattimore, Csaba Szepesvári +1
Generative AI for Biosciences: Emerging Threats and Roadmap to Biosecurity
Zaixi Zhang, Souradip Chakraborty, Amrit Singh Bedi +16
Local Fourier uniformity of higher divisor functions on average
Mengdi Wang