Publications (50)
How Far Are We from Intelligent Visual Deductive Reasoning?
Yizhe Zhang, He Bai, Ruixiang Zhang +4
Learning Long-term Motion Embeddings for Efficient Kinematics Generation
Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3
Improving GFlowNets for Text-to-Image Diffusion Alignment
Dinghuai Zhang, Yizhe Zhang, Jiatao Gu +4
Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP
Chen Huang, Skyler Seto, Samira Abnar +3
Normalizing Flows are Capable Generative Models
Shuangfei Zhai, Ruixiang Zhang, Preetum Nakkiran +7
TADA: Improved Diffusion Sampling with Training-free Augmented Dynamics
Tianrong Chen, Huangjie Zheng, David Berthelot +3
STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
Jiatao Gu, Tianrong Chen, David Berthelot +7
Value function estimation using conditional diffusion models for control
Bogdan Mazoure, Walter Talbott, Miguel Angel Bautista +3
Text-Conditional JEPA for Learning Semantically Rich Visual Representations
Chen Huang, Xianhang Li, Vimal Thilak +2
Normalizing Trajectory Models
Jiatao Gu, Tianrong Chen, Ying Shen +3
The Coupling Within: Flow Matching via Distilled Normalizing Flows
David Berthelot, Tianrong Chen, Jiatao Gu +6
Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization
Yuhang Zang, Hanlin Goh, Josh Susskind +1
GAUDI: A Neural Architect for Immersive 3D Scene Generation
Miguel Angel Bautista, Pengsheng Guo, Samira Abnar +9
Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models
Samira Abnar, Harshay Shah, Dan Busbridge +3
BOOT: Data-free Distillation of Denoising Diffusion Models with Bootstrapping
Jiatao Gu, Shuangfei Zhai, Yizhe Zhang +2
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
Ruixiang Zhang, Shuangfei Zhai, Jiatao Gu +6
Adaptivity and Modularity for Efficient Generalization Over Task Complexity
Samira Abnar, Omid Saremi, Laurent Dinh +8
Regularized Training of Nearest Neighbor Language Models
Jean-Francois Ton, Walter Talbott, Shuangfei Zhai +1
To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models
Eran Malach, Omid Saremi, Sinead Williamson +5
The Design Space of Tri-Modal Masked Diffusion Models
Louis Bethune, Victor Turrisi, Bruno Kacper Mlodozeniec +21
Boolformer: Symbolic Regression of Logic Functions with Transformers
Stéphane d'Ascoli, Arthur Renard, Vassilis Papadopoulos +3
Proxy-FDA: Proxy-based Feature Distribution Alignment for Fine-tuning Vision Foundation Models without Forgetting
Chen Huang, Skyler Seto, Hadi Pouransari +6
Matryoshka Diffusion Models
Jiatao Gu, Shuangfei Zhai, Yizhe Zhang +2
On the benefits of pixel-based hierarchical policies for task generalization
Tudor Cristea-Platon, Bogdan Mazoure, Josh Susskind +1
What Algorithms can Transformers Learn? A Study in Length Generalization
Hattie Zhou, Arwen Bradley, Etai Littwin +5
Show Me Examples: Inferring Visual Concepts from Image Sets
Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3
Learning Representation from Neural Fisher Kernel with Low-rank Approximation
Ruixiang Zhang, Shuangfei Zhai, Etai Littwin +1
Adapting Self-Supervised Representations as a Latent Space for Efficient Generation
Ming Gui, Johannes Schusterbauer, Timy Phan +4
Construction of Paired Knowledge Graph-Text Datasets Informed by Cyclic Evaluation
Ali Mousavi, Xin Zhan, He Bai +9
NerfDiff: Single-image View Synthesis with NeRF-guided Distillation from 3D-aware Diffusion
Jiatao Gu, Alex Trevithick, Kai-En Lin +4
MetricOpt: Learning to Optimize Black-Box Evaluation Metrics
Chen Huang, Shuangfei Zhai, Pengsheng Guo +1
Learning from Simulated and Unsupervised Images through Adversarial Training
Ashish Shrivastava, Tomas Pfister, Oncel Tuzel +3
f-DM: A Multi-stage Diffusion Model via Progressive Signal Transformation
Jiatao Gu, Shuangfei Zhai, Yizhe Zhang +2
Control3Diff: Learning Controllable 3D Diffusion Models from Single-view Images
Jiatao Gu, Qingzhe Gao, Shuangfei Zhai +3
Addressing the Loss-Metric Mismatch with Adaptive Loss Alignment
Chen Huang, Shuangfei Zhai, Walter Talbott +4
Stabilizing Transformer Training by Preventing Attention Entropy Collapse
Shuangfei Zhai, Tatiana Likhomanenko, Etai Littwin +5
STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
Jiatao Gu, Ying Shen, Tianrong Chen +6
An Attention Free Transformer
Shuangfei Zhai, Walter Talbott, Nitish Srivastava +4
SimpleFold: Folding Proteins is Simpler than You Think
Yuyang Wang, Jiarui Lu, Navdeep Jaitly +2
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
Jiatao Gu, Yuyang Wang, Yizhe Zhang +5
Rethinking JEPA: Compute-Efficient Video SSL with Frozen Teachers
Xianhang Li, Chen Huang, Chun-Liang Li +4
3D Shape Tokenization via Latent Flow Matching
Jen-Hao Rick Chang, Yuyang Wang, Miguel Angel Bautista Martin +4
Robust Robotic Control from Pixels using Contrastive Recurrent State-Space Models
Nitish Srivastava, Walter Talbott, Martin Bertran Lopez +2
INRFlow: Flow Matching for INRs in Ambient Space
Yuyang Wang, Anurag Ranjan, Josh Susskind +1
Efficient Representation Learning via Adaptive Context Pooling
Chen Huang, Walter Talbott, Navdeep Jaitly +1
How PARTs assemble into wholes: Learning the relative composition of images
Melika Ayoughi, Samira Abnar, Chen Huang +10
Equivariant Neural Rendering
Emilien Dupont, Miguel Angel Bautista, Alex Colburn +4
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
Yizhe Zhang, Jiatao Gu, Zhuofeng Wu +3
MAST: Masked Augmentation Subspace Training for Generalizable Self-Supervised Priors
Chen Huang, Hanlin Goh, Jiatao Gu +1
TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models
Georgia Gabriela Sampaio, Ruixiang Zhang, Shuangfei Zhai +4