1 paper
Jinwoong Kim, Rui Yang, Huishuai Zhang
We introduce GeoBuildBench, a benchmark designed to evaluate whether large language models and multimodal agents can ground informal natural-language plane geometry problems into e…