1 paper
Wenyi Wu, Sibo Zhu, Kun Zhou +3
Recent advances in large language models (LLMs) and vision-language models (VLMs) have enabled increasingly capable digital agents for computer use. However, real-world tasks are o…