1 paper
Estelle Aflalo, Gabriela Ben Melech Stan, Tiep Le +5
Large Vision Language Models (LVLMs) have achieved significant progress in integrating visual and textual inputs for multimodal reasoning. However, a recurring challenge is ensurin…