1 paper · 1 filter
Mingxiao Huo, Jiayi Zhang, Hewei Wang +4
Vision-Language Models (VLMs) enable powerful multimodal reasoning but suffer from slow autoregressive inference, limiting their deployment in real-time applications. We introduce…