2 papers
cs.CV2026
VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning
Zi-Yi Jia, Zi-Jian Cheng, Xin-Yue Zhang +4
Multi-model learning has attracted great attention in visual-text tasks. However, visual-tabular data, which plays a pivotal role in high-stakes domains like healthcare and industr…
cs.CV2025
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
Jingkun Yue, Siqi Zhang, Zinan Jia +4
Visual grounding is essential for precise perception and reasoning in multimodal large language models (MLLMs), especially in medical imaging domains. While existing medical visual…