1 paper
Md Kaykobad Reza, Ameya Patil, Edward Ayrapetian +1
Multimodal large language models (MLLMs) achieve strong performance by jointly processing inputs from multiple modalities, such as vision, audio, and language. However, building su…