1 paper · 1 filter
Joel Currie, Gioele Migno, Enrico Piacenti +4
We present a conceptual framework for training Vision-Language Models (VLMs) to perform Visual Perspective Taking (VPT), a core capability for embodied cognition essential for Huma…