NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (50)

cs.AI2024

How Far Are We from Intelligent Visual Deductive Reasoning?

Yizhe Zhang, He Bai, Ruixiang Zhang +4

cs.CV2026

Learning Long-term Motion Embeddings for Efficient Kinematics Generation

Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3

cs.LG2024

Improving GFlowNets for Text-to-Image Diffusion Alignment

Dinghuai Zhang, Yizhe Zhang, Jiatao Gu +4

cs.LG2024

Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP

Chen Huang, Skyler Seto, Samira Abnar +3

cs.CV2025

Normalizing Flows are Capable Generative Models

Shuangfei Zhai, Ruixiang Zhang, Preetum Nakkiran +7

stat.ML2025

TADA: Improved Diffusion Sampling with Training-free Augmented Dynamics

Tianrong Chen, Huangjie Zheng, David Berthelot +3

cs.CV2025

STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis

Jiatao Gu, Tianrong Chen, David Berthelot +7

cs.LG2023

Value function estimation using conditional diffusion models for control

Bogdan Mazoure, Walter Talbott, Miguel Angel Bautista +3

cs.LG2026

Text-Conditional JEPA for Learning Semantically Rich Visual Representations

Chen Huang, Xianhang Li, Vimal Thilak +2

cs.CV2026

Normalizing Trajectory Models

Jiatao Gu, Tianrong Chen, Ying Shen +3

cs.LG2026

The Coupling Within: Flow Matching via Distilled Normalizing Flows

David Berthelot, Tianrong Chen, Jiatao Gu +6

cs.CV2024

Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization

Yuhang Zang, Hanlin Goh, Josh Susskind +1

cs.CV2022

GAUDI: A Neural Architect for Immersive 3D Scene Generation

Miguel Angel Bautista, Pengsheng Guo, Samira Abnar +9

cs.LG2025

Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models

Samira Abnar, Harshay Shah, Dan Busbridge +3

cs.CV2023

BOOT: Data-free Distillation of Denoising Diffusion Models with Bootstrapping

Jiatao Gu, Shuangfei Zhai, Yizhe Zhang +2

cs.LG2025

Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows

Ruixiang Zhang, Shuangfei Zhai, Jiatao Gu +6

cs.LG2023

Adaptivity and Modularity for Efficient Generalization Over Task Complexity

Samira Abnar, Omid Saremi, Laurent Dinh +8

cs.CL2021

Regularized Training of Nearest Neighbor Language Models

Jean-Francois Ton, Walter Talbott, Shuangfei Zhai +1

cs.LG2025

To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models

Eran Malach, Omid Saremi, Sinead Williamson +5

cs.LG2026

The Design Space of Tri-Modal Masked Diffusion Models

Louis Bethune, Victor Turrisi, Bruno Kacper Mlodozeniec +21

cs.LG2025

Boolformer: Symbolic Regression of Logic Functions with Transformers

Stéphane d'Ascoli, Arthur Renard, Vassilis Papadopoulos +3

cs.LG2025

Proxy-FDA: Proxy-based Feature Distribution Alignment for Fine-tuning Vision Foundation Models without Forgetting

Chen Huang, Skyler Seto, Hadi Pouransari +6

cs.CV2024

Matryoshka Diffusion Models

Jiatao Gu, Shuangfei Zhai, Yizhe Zhang +2

cs.LG2024

On the benefits of pixel-based hierarchical policies for task generalization

Tudor Cristea-Platon, Bogdan Mazoure, Josh Susskind +1

cs.LG2023

What Algorithms can Transformers Learn? A Study in Length Generalization

Hattie Zhou, Arwen Bradley, Etai Littwin +5

cs.CV2026

Show Me Examples: Inferring Visual Concepts from Image Sets

Nick Stracke, Kolja Bauer, Stefan Andreas Baumann +3

cs.LG2022

Learning Representation from Neural Fisher Kernel with Low-rank Approximation

Ruixiang Zhang, Shuangfei Zhai, Etai Littwin +1

cs.CV2026

Adapting Self-Supervised Representations as a Latent Space for Efficient Generation

Ming Gui, Johannes Schusterbauer, Timy Phan +4

cs.CL2023

Construction of Paired Knowledge Graph-Text Datasets Informed by Cyclic Evaluation

Ali Mousavi, Xin Zhan, He Bai +9

cs.CV2023

NerfDiff: Single-image View Synthesis with NeRF-guided Distillation from 3D-aware Diffusion

Jiatao Gu, Alex Trevithick, Kai-En Lin +4

cs.LG2021

MetricOpt: Learning to Optimize Black-Box Evaluation Metrics

Chen Huang, Shuangfei Zhai, Pengsheng Guo +1

cs.CV2017

Learning from Simulated and Unsupervised Images through Adversarial Training

Ashish Shrivastava, Tomas Pfister, Oncel Tuzel +3

cs.CV2022

f-DM: A Multi-stage Diffusion Model via Progressive Signal Transformation

Jiatao Gu, Shuangfei Zhai, Yizhe Zhang +2

cs.CV2023

Control3Diff: Learning Controllable 3D Diffusion Models from Single-view Images

Jiatao Gu, Qingzhe Gao, Shuangfei Zhai +3

cs.LG2019

Addressing the Loss-Metric Mismatch with Adaptive Loss Alignment

Chen Huang, Shuangfei Zhai, Walter Talbott +4

cs.LG2023

Stabilizing Transformer Training by Preventing Attention Entropy Collapse

Shuangfei Zhai, Tatiana Likhomanenko, Etai Littwin +5

cs.CV2025

STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows

Jiatao Gu, Ying Shen, Tianrong Chen +6

cs.LG2021

An Attention Free Transformer

Shuangfei Zhai, Walter Talbott, Nitish Srivastava +4

cs.LG2025

SimpleFold: Folding Proteins is Simpler than You Think

Yuyang Wang, Jiarui Lu, Navdeep Jaitly +2

cs.CV2025

DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation

Jiatao Gu, Yuyang Wang, Yizhe Zhang +5

cs.LG2025

Rethinking JEPA: Compute-Efficient Video SSL with Frozen Teachers

Xianhang Li, Chen Huang, Chun-Liang Li +4

cs.CV2025

3D Shape Tokenization via Latent Flow Matching

Jen-Hao Rick Chang, Yuyang Wang, Miguel Angel Bautista Martin +4

cs.LG2021

Robust Robotic Control from Pixels using Contrastive Recurrent State-Space Models

Nitish Srivastava, Walter Talbott, Martin Bertran Lopez +2

cs.LG2025

INRFlow: Flow Matching for INRs in Ambient Space

Yuyang Wang, Anurag Ranjan, Josh Susskind +1

cs.LG2022

Efficient Representation Learning via Adaptive Context Pooling

Chen Huang, Walter Talbott, Navdeep Jaitly +1

cs.CV2025

How PARTs assemble into wholes: Learning the relative composition of images

Melika Ayoughi, Samira Abnar, Chen Huang +10

cs.CV2020

Equivariant Neural Rendering

Emilien Dupont, Miguel Angel Bautista, Alex Colburn +4

cs.CL2024

PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model

Yizhe Zhang, Jiatao Gu, Zhuofeng Wu +3

cs.LG2023

MAST: Masked Augmentation Subspace Training for Generalizable Self-Supervised Priors

Chen Huang, Hanlin Goh, Jiatao Gu +1

cs.CV2024

TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models

Georgia Gabriela Sampaio, Ruixiang Zhang, Shuangfei Zhai +4