Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan +5
Automatically retrieving videos from large camera-trap datasets remains challenging. Text-to-Video retrieval (TVR) methods based on large video-language models (VLMs) have potentia…
cs.CV2026
WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife
Vandita Shukla, Kilian Meier, Lucie Laporte-Devylder +6
We introduce WildBox, a dataset and benchmark for monocular 3D detection of wildlife from drone video, comprising 237,505 3D bounding box annotations across seven African savanna s…