1 citations · 1 across the 7 of their papers we have counts for
21 papers
VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers
Xianghong Fang, Yuan Yuan, Dehan Kong +1
Vector Quantization (VQ) underpins modern discrete visual tokenization. However, training quantization modules for state-of-the-art VQ-based models requires significant computation…
Temporal Straightening for Latent Planning
Ying Wang, Oumayma Bounou, Gaoyue Zhou +4
Learning good representations is essential for latent planning with world models. While pretrained visual encoders produce strong semantic visual features, they are not tailored to…
A Continuous-Time Markov Chain Framework for Insertion Language Models
Dhruvesh Patel, Benjamin Rozonoyer, Soumitra Das +3
Insertion Language Models (ILMs) offer several advantages over left-to-right generation and mask-based generation. However, existing formulations of insertion-based generation have…
Learned Relay Representations for Forward-Thinking Discrete Diffusion Models
Benjamin Rozonoyer, Jacopo Minniti, Dhruvesh Patel +4
When Masked Diffusion Models (MDMs) generate sequences through iterative refinement, the rich internal computation over masked positions is discarded, forcing every subsequent refi…
Rectified LpJEPA: Joint-Embedding Predictive Architectures with Sparse and Maximum-Entropy Representations
Yilun Kuang, Yash Dagade, Tim G. J. Rudner +2
Joint-Embedding Predictive Architectures (JEPA) learn view-invariant representations and admit projection-based distribution matching for collapse prevention. Existing approaches r…
An Empirical Analysis of Calibration and Selective Prediction in Multimodal Clinical Condition Classification
L. Julián Lechuga López, Farah E. Shamout, Tim G. J. Rudner
As artificial intelligence systems move toward clinical deployment, ensuring reliable prediction behavior is fundamental for safety-critical decision-making tasks. One proposed saf…