1 paper
Yanting Miao, Yutao Sun, Dexin Wang +8
Visual latent reasoning lets a multimodal large language model (MLLM) create intermediate visual evidence as continuous tokens, avoiding external tools or image generators. However…