1 paper
Daniel Harari, Michael Sidorov, Chen Shterental +3
Large multi-modal models (LMMs) show increasing performance in realistic visual tasks for images and, more recently, for videos. For example, given a video sequence, such models ar…