1 paper · 1 filter
Guy Yariv, Idan Schwartz, Yossi Adi +1
Commonsense reasoning often requires both textual and visual knowledge, yet Large Language Models (LLMs) trained solely on text lack visual grounding (e.g., "what color is an emper…