Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
TDDN: Text-aligned Diffused DINO Network for Puzzle Understanding
Harsha Patnala, Debopriyo Banerjee, Ayush Sunil Munot +1
Structured visual reasoning, such as image puzzles, demands fine-grained visual perception, an ability current Vision Language Models (VLMs) lack. VLMs built on CLIP-based ViT back…
cs.CV2026
MVEB: Massive Video Embedding Benchmark
Adnan El Assadi, Roman Solomatin, Isaac Chung +13
We introduce the Massive Video Embedding Benchmark (MVEB), a 23-task benchmark for video embeddings spanning classification, zero-shot classification, clustering, pair classificati…