1 paper
Jiawei Liu, Enis Berk Ãoban, Zarina Schevchenko +4
Standard training for Multi-modal Large Language Models (MLLMs) involves concatenating non-textual information, like vision or audio, with a text prompt. This approach may not enco…