papers
Publications (14)
cs.CV2021
Omnidata: A Scalable Pipeline for Making Multi-Task Mid-Level Vision Datasets from 3D Scans
Ainaz Eftekhar, Alexander Sax, Roman Bachmann +2
cs.CV2026
How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks
Rahul Ramachandran, Ali Garjani, Roman Bachmann +3
cs.CV2025
FlexTok: Resampling Images into 1D Token Sequences of Flexible Length
Roman Bachmann, Jesse Allardice, David Mizrahi +6
cs.CV2026
VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization
Andrei Atanov, Jesse Allardice, Roman Bachmann +6
cs.CV2026
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
Mingqiao Ye, Zhaochong An, Zhitong Gao +11
cs.AI2026
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
OÄuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong +2
cs.CV2026
(1D) Ordered Tokens Enable Efficient Test-Time Search
Zhitong Gao, Parham Rezaei, Ali Cy +7
cs.CV2024
4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities
Roman Bachmann, OÄuzhan Fatih Kar, David Mizrahi +6
cs.CV2023
Modality-invariant Visual Odometry for Embodied Vision
Marius Memmel, Roman Bachmann, Amir Zamir
cs.CV2022
MultiMAE: Multi-modal Multi-task Masked Autoencoders
Roman Bachmann, David Mizrahi, Andrei Atanov +1
cs.CV2019
Motion Capture from Pan-Tilt Cameras with Unknown Orientation
Roman Bachmann, Jörg Spörri, Pascal Fua +1
cs.CV2024
ViPer: Visual Personalization of Generative Models via Individual Preference Learning
Sogand Salehi, Mahdi Shafiei, Teresa Yeo +2
cs.CV2023
4M: Massively Multimodal Masked Modeling
David Mizrahi, Roman Bachmann, OÄuzhan Fatih Kar +4
cs.LG2020
Training Binary Neural Networks using the Bayesian Learning Rule
Xiangming Meng, Roman Bachmann, Mohammad Emtiyaz Khan