1 paper
Kyosuke Takami, Yuka Tateisi, Satoshi Sekine +1
Authentic school examinations provide a high-validity test bed for evaluating multimodal large language models (MLLMs), yet benchmarks grounded in Japanese K-12 assessments remain…