1 paper · 1 filter
Yeji Park, Minyoung Lee, Sanghyuk Chun +1
Large Vision-Language Models (LVLMs) exhibit strong performance on single-image tasks. However, their performance degrades significantly when handling multi-image inputs. While thi…