1 paper
William Leach, Ru He, Sizhuo Ma +4
Vision-language models (VLMs) are increasingly attractive for multimodal quality assessment, but their default reliance on autoregressive text generation and dynamic visual process…