1 paper
Rithvik Jonna, Aakash Gurram, Man Namgung +2
Vision-Language Models (VLMs) for embodied navigation rely on selecting a fixed number of frames from a growing trajectory history. As episodes extend, this selection grows increas…