8 papers
Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
Yu Zhang, Jialei Zhou, Xinchen Li +6
Current text-to-image diffusion generation typically employs complete-text conditioning. Due to the intricate syntax, diffusion transformers (DiTs) inherently suffer from a compreh…
Markovian Scale Prediction: A New Era of Visual Autoregressive Generation
Yu Zhang, Jingyi Liu, Yiwei Shi +4
Visual AutoRegressive modeling (VAR) based on next-scale prediction has revitalized autoregressive visual generation. Although its full-context dependency, i.e., modeling all previ…
Swordsman: Entropy-Driven Adaptive Block Partition for Efficient Diffusion Language Models
Yu Zhang, Xinchen Li, Jialei Zhou +6
Block-wise decoding effectively improves the inference speed and quality in diffusion language models (DLMs) by combining inter-block sequential denoising and intra-block parallel…
Adaptive Visual Autoregressive Acceleration via Dual-Linkage Entropy Analysis
Yu Zhang, Jingyi Liu, Feng Liu +5
Visual AutoRegressive modeling (VAR) suffers from substantial computational cost due to the massive token count involved. Failing to account for the continuous evolution of modelin…
DE-BERT: Distance-Enhanced Early Exiting for BERT based on Prototypical Networks
Jianing He, Qi Zhang, Weiping Ding +4
Early exiting has demonstrated its effectiveness in accelerating the inference of pre-trained language models like BERT by dynamically adjusting the number of layers executed. Howe…
Revealing Multimodal Causality with Large Language Models
Jin Li, Shoujin Wang, Qi Zhang +5
Uncovering cause-and-effect mechanisms from data is fundamental to scientific progress. While large language models (LLMs) show promise for enhancing causal discovery (CD) from uns…