Showing cs.CVShow all
2 papers · 1 filter
cs.CV2025
PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
Shuoshuo Zhang, Zijian Li, Yizhen Zhang +6
Structured images (e.g., charts and geometric diagrams) remain challenging for multimodal large language models (MLLMs), as perceptual slips can cascade into erroneous conclusions.…
cs.CV2025
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
Zijian Li, Jingjing Fu, Lei Song +3
Visual reasoning is crucial for multimodal large language models (MLLMs) to address complex chart queries, yet high-quality rationale data remains scarce. Existing methods leverage…