3 papers
cs.CV2026
GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing
Zifeng Zhu, Jiaming Han, Jiaxiang Zhao +2
While Diffusion Large Language Models (DLLMs) have demonstrated remarkable capabilities in multi-modal generation, performing precise, training-free image editing remains an open c…
cs.CL2025
GuessBench: Sensemaking Multimodal Creativity in the Wild
Zifeng Zhu, Shangbin Feng, Herun Wan +3
We propose GuessBench, a novel benchmark that evaluates Vision Language Models (VLMs) on modeling the pervasive, noisy, and pluralistic human creativity. GuessBench sources data fr…
cs.CL2025
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
Zifeng Zhu, Mengzhao Jia, Zhihan Zhang +2
Multimodal Large Language Models (MLLMs) have demonstrated impressive abilities across various tasks, including visual question answering and chart comprehension, yet existing benc…