1 paper · 1 filter
Jiani Huang, Amish Sethi, Matthew Kuo +6
Multi-modal large language models (MLLMs) are making rapid progress toward general-purpose embodied agents. However, existing MLLMs do not reliably capture fine-grained links betwe…