1 paper · 1 filter
Zhuoran Yu, Le Thien Phuc Nguyen, Jaden Park +5
Multimodal Large Language Models (MLLMs) have achieved strong performance on structured visual understanding tasks such as chart and document question answering. However, existing…