1 paper · 1 filter
William Leach, Ru He, Sizhuo Ma +4
Vision-language models (VLMs) are increasingly attractive for multimodal quality assessment, but their default reliance on autoregressive text generation and dynamic visual process…