2 papers
cs.CL2026
MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models
Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi +2
We present MaterialFigBench, a benchmark dataset designed to evaluate the ability of multimodal large language models (LLMs) to solve university-level materials science problems th…
cs.CL2024
MaterialBENCH: Evaluating College-Level Materials Science Problem-Solving Abilities of Large Language Models
Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi +2
A college-level benchmark dataset for large language models (LLMs) in the materials science field, MaterialBENCH, is constructed. This dataset consists of problem-answer pairs, bas…