3 papers
cs.CV2026
BitDance: Scaling Autoregressive Generative Models with Binary Tokens
Yuang Ai, Jiaming Han, Shaobin Zhuang +8
We present BitDance, a scalable autoregressive (AR) image generator that predicts binary visual tokens instead of codebook indices. With high-entropy binary latents, BitDance lets…
cs.CV2026
Implicit Neural Representation Facilitates Unified Universal Vision Encoding
Matthew Gwilliam, Xiao Wang, Xuefeng Hu +1
Models for image representation learning are typically designed for either recognition or generation. Various forms of contrastive learning help models learn to convert images to e…
cs.CV2025
DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
Yuang Ai, Qihang Fan, Xuefeng Hu +3
Diffusion Transformer (DiT), a promising diffusion model for visual generation, demonstrates impressive performance but incurs significant computational overhead. Intriguingly, ana…