papers
Publications (14)
cs.CV2022
Revisiting the "Video" in Video-Language Understanding
Shyamal Buch, Cristóbal Eyzaguirre, Adrien Gaidon +3
cs.CV2026
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
Arsha Nagrani, Jasper Uijilings, Shyamal Buch +6
cs.CL2025
Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
Gheorghe Comanici, Eric Bieber, Mike Schaekermann +3431
cs.CV2025
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
Monika WysoczaÅska, Shyamal Buch, Anurag Arnab +1
cs.CV2024
Streaming Detection of Queried Event Start
Cristobal Eyzaguirre, Eric Tang, Shyamal Buch +3
cs.LG2022
On the Opportunities and Risks of Foundation Models
Rishi Bommasani, Drew A. Hudson, Ehsan Adeli +111
cs.CV2024
Streaming Dense Video Captioning
Xingyi Zhou, Anurag Arnab, Shyamal Buch +5
cs.CV2018
The ActivityNet Large-Scale Activity Recognition Challenge 2018 Summary
Bernard Ghanem, Juan Carlos Niebles, Cees Snoek +6
cs.CV2025
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
Juhong Min, Shyamal Buch, Arsha Nagrani +2
cs.CV2024
Mixture of Nested Experts: Adaptive Processing of Visual Tokens
Gagan Jain, Nidhi Hegde, Aditya Kusupati +5
cs.CV2017
ActivityNet Challenge 2017 Summary
Bernard Ghanem, Juan Carlos Niebles, Cees Snoek +6
cs.RO2021
BEHAVIOR: Benchmark for Everyday Household Activities in Virtual, Interactive, and Ecological Environments
Sanjana Srivastava, Chengshu Li, Michael Lingelbach +11
cs.LG2025
MINERVA: Evaluating Complex Video Reasoning
Arsha Nagrani, Sachit Menon, Ahmet Iscen +9
cs.AI2021
iGibson 1.0: a Simulation Environment for Interactive Tasks in Large Realistic Scenes
Bokui Shen, Fei Xia, Chengshu Li +12