13 citations · 15 across the 3 of their papers we have counts for
3 papers
cs.CL2025★ 1 cited
Open-Qwen2VL: Compute-Efficient Pre-Training of Fully-Open Multimodal LLMs on Academic Resources
Weizhi Wang, Yu Tian, Linjie Yang +2
The reproduction of state-of-the-art multimodal LLM pre-training faces barriers at every stage of the pipeline, including high-quality data filtering, multimodal data mixture strat…
cs.CV2024★ 1 cited
Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters
Weizhi Wang, Khalil Mrini, Linjie Yang +4
We propose a novel framework for filtering image-text data by leveraging fine-tuned Multimodal Language Models (MLMs). Our approach outperforms predominant filtering methods (e.g.,…
cs.CV2023★ 13 cited
GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks
Xinlu Zhang, Yujie Lu, Weizhi Wang +7
Automatically evaluating vision-language tasks is challenging, especially when it comes to reflecting human judgments due to limitations in accounting for fine-grained details. Alt…