1 paper
Mohamad Al Mdfaa, Svetlana Lukina, Timur Akhtyamov +4
Vision-language models (VLMs) demonstrate strong image-level scene understanding, but reasoning over long egocentric video remains costly: because VLMs maintain no persistent memor…