1 paper · 1 filter
Yuke Li, Xuehan Hou
GUI agents are shifting from metadata-dependent large language models to purely visual multimodal large language models (MLLMs) that operate directly on screenshots. The core task,…