1 paper · 1 filter
Zijie Li, Henry Li, Yichun Shi +4
Diffusion models have gained tremendous success in text-to-image generation, yet still lag behind with visual understanding tasks, an area dominated by autoregressive vision-langua…