1 paper
Hao Yi, Qingyang Li, Yulan Hu +3
High-quality video-text preference data is crucial for Multimodal Large Language Models (MLLMs) alignment. However, existing preference data is very scarce. Obtaining VQA preferenc…