3 papers
cs.AI2026
EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents
Sai Ma, Zhuang Li, Sichao Li +4
Earth Observation (EO) analysis is inherently interactive: resolving uncertainty often requires expanding the region of interest, retrieving historical observations, and switching…
cs.AI2025
Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs
Junxian Li, Xinyue Xu, Sai Ma +2
Multimodal Large Language Models (MLLMs) frequently suffer from unfaithfulness, generating reasoning chains that drift from visual evidence or contradict final predictions. We prop…
cs.CV2025
Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery
Sai Ma, Zhuang Li, John A Taylor
Vision language models (VLMs) that enable natural language interaction with satellite imagery can democratize Earth observation by accelerating expert workflows, making data access…