Publications (29)
MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
Kaixin Ma, Di Feng, Alexander Metz +3
The paper introduces MM-ToolSandBox, a benchmark and evaluation framework for visually grounded tool-calling agents that handle multi-image, multi-turn tasks across hundreds of too…
Deep Tracking: Visual Tracking Using Deep Convolutional Networks
Meera Hahn, Si Chen, Afshin Dehghan
GAUDI: A Neural Architect for Immersive 3D Scene Generation
Miguel Angel Bautista, Pengsheng Guo, Samira Abnar +9
Language Models Improve When Pretraining Data Matches Target Tasks
David Mizrahi, Anders Boesen Lindbo Larsen, Jesse Allardice +7
Binary Quadratic Programing for Online Tracking of Hundreds of People in Extremely Crowded Scenes
Afshin Dehghan, Mubarak Shah
Apple Intelligence Foundation Language Models: Tech Report 2025
Ethan Li, Anders Boesen Lindbo Larsen, Chen Zhang +395
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
Di Feng, Kaixin Ma, Feng Nan +9
FlexTok: Resampling Images into 1D Token Sequences of Flexible Length
Roman Bachmann, Jesse Allardice, David Mizrahi +6
SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
Mingze Xu, Mingfei Gao, Zhe Gan +5
VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization
Andrei Atanov, Jesse Allardice, Roman Bachmann +6
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
Haibo Wang, Bo Feng, Zhengfeng Lai +6
DAGER: Deep Age, Gender and Emotion Recognition Using Convolutional Neural Network
Afshin Dehghan, Enrique G. Ortiz, Guang Shu +1
Cubify Anything: Scaling Indoor 3D Object Detection
Justin Lazarow, David Griffiths, Gefen Kohavi +2
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
Rui Tian, Mingfei Gao, Mingze Xu +5
MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
Mingqiao Ye, Zhaochong An, Zhitong Gao +11
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
OÄuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong +2
Rooms from Motion: Un-posed Indoor 3D Object Detection as Localization and Mapping
Justin Lazarow, Kai Kang, Afshin Dehghan
(1D) Ordered Tokens Enable Efficient Test-Time Search
Zhitong Gao, Parham Rezaei, Ali Cy +7
ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data
Gilad Baruch, Zhuoyuan Chen, Afshin Dehghan +8
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
Mingze Xu, Mingfei Gao, Shiyu Li +7
4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities
Roman Bachmann, OÄuzhan Fatih Kar, David Mizrahi +6
AToken: A Unified Tokenizer for Vision
Jiasen Lu, Liangchen Song, Mingze Xu +5
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
Rui Tian, Mingfei Gao, Haiming Gang +5
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
Haotian Zhang, Mingfei Gao, Zhe Gan +20
4M: Massively Multimodal Masked Modeling
David Mizrahi, Roman Bachmann, OÄuzhan Fatih Kar +4
View Independent Vehicle Make, Model and Color Recognition Using Convolutional Neural Network
Afshin Dehghan, Syed Zain Masood, Guang Shu +1
License Plate Detection and Recognition Using Deeply Learned Convolutional Neural Networks
Syed Zain Masood, Guang Shu, Afshin Dehghan +1
MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs
Erik Daxberger, Nina Wenzel, David Griffiths +8
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
Elmira Amirloo, Jean-Philippe Fauconnier, Christoph Roesmann +8