Publications (19)
Sideways: Depth-Parallel Training of Video Models
Mateusz Malinowski, Grzegorz Swirszcz, Joao Carreira +1
Broaden Your Views for Self-Supervised Video Learning
Adrià Recasens, Pauline Luc, Jean-Baptiste Alayrac +11
Causal Evidence that Language Models use Confidence to Drive Behavior
Dharshan Kumaran, Nathaniel Daw, Simon Osindero +2
Gradient Forward-Propagation for Large-Scale Temporal Video Modelling
Mateusz Malinowski, Dimitrios Vytiniotis, Grzegorz Swirszcz +2
Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
Gheorghe Comanici, Eric Bieber, Mike Schaekermann +3431
A Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 Frames
Pinelopi Papalampidi, Skanda Koppula, Shreya Pathak +7
SceneNet: Understanding Real World Indoor Scenes With Synthetic Data
Ankur Handa, Viorica Patraucean, Vijay Badrinarayanan +2
Unique Lives, Shared World: Learning from Single-Life Videos
Tengda Han, Sayna Ebrahimi, Dilara Gokay +8
Active Acquisition for Multimodal Temporal Data: A Challenging Decision-Making Task
Jannik Kossen, CÄtÄlina Cangea, Eszter Vértes +5
Spatio-temporal video autoencoder with differentiable memory
Viorica Patraucean, Ankur Handa, Roberto Cipolla
How do LLMs Compute Verbal Confidence
Dharshan Kumaran, Arthur Conmy, Federico Barbero +3
How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals
Dharshan Kumaran, Viorica Patraucean, Simon Osindero +2
SynthCam3D: Semantic Understanding With Synthetic Indoor Scenes
Ankur Handa, Viorica Patraucean, Vijay Badrinarayanan +2
The Computational Basis of Confidence in Large Language Models
Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov +3
The paper investigates what the confidence signal in large language models actually represents, showing that answer logits often act as monotonic readouts of a latent decision vari…
How Overconfidence in Initial Choices and Underconfidence Under Criticism Modulate Change of Mind in Large Language Models
Dharshan Kumaran, Stephen M Fleming, Larisa Markeeva +8
Massively Parallel Video Networks
Joao Carreira, Viorica Patraucean, Laurent Mazare +2
gvnn: Neural Network Library for Geometric Computer Vision
Ankur Handa, Michael Bloesch, Viorica Patraucean +3
TAPNext: Tracking Any Point (TAP) as Next Token Prediction
Artem Zholus, Carl Doersch, Yi Yang +7
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Gemini Team, Petko Georgiev, Ving Ian Lei +1132