1 paper
Hongyuan Tao, Xinggang Wang, Lianghui Zhu +7
We present Multimodal Flow, a fully continuous generative model of language and vision. Most unified multimodal models either model both language and quantized images as discrete t…