papers
Publications (7)
cs.CV2025
FlexTok: Resampling Images into 1D Token Sequences of Flexible Length
Roman Bachmann, Jesse Allardice, David Mizrahi +6
cs.LG2025
Apple Intelligence Foundation Language Models: Tech Report 2025
Ethan Li, Anders Boesen Lindbo Larsen, Chen Zhang +395
cs.CV2024
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
Elmira Amirloo, Jean-Philippe Fauconnier, Christoph Roesmann +8
cs.CV2022
LatentFormer: Multi-Agent Transformer-Based Interaction Modeling and Trajectory Prediction
Elmira Amirloo, Amir Rasouli, Peter Lakner +2
cs.CV2021
Self-Supervised Simultaneous Multi-Step Prediction of Road Dynamics and Cost Map
Elmira Amirloo, Mohsen Rohani, Ershad Banijamali +2
cs.CV2026
BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning
Shaokai Ye, Vasileios Saveris, Yihao Qian +3
cs.LG2020
Prediction by Anticipation: An Action-Conditional Prediction Method based on Interaction Learning
Ershad Banijamali, Mohsen Rohani, Elmira Amirloo +2