2 papers
cs.CV2025
Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality
Daulet Toibazar, Kesen Wang, Sherif Mohamed +3
Vision-language models (VLMs) extend the conventional large language models by integrating visual data, enabling richer multimodal reasoning and significantly broadens the practica…
cs.CL2025
Multi-Agent Interactive Question Generation Framework for Long Document Understanding
Kesen Wang, Daulet Toibazar, Abdulrahman Alfulayt +6
Document Understanding (DU) in long-contextual scenarios with complex layouts remains a significant challenge in vision-language research. Although Large Vision-Language Models (LV…