1 paper
Taiting Lu, Kaiyuan Lin, Yuxin Tian +13
Recent large multimodal models (LMMs) have made rapid progress in visual grounding, document understanding, and diagram reasoning tasks. However, their ability to convert Printed C…