1 paper
Yizhou Liu, Jinghang Han, Kaixiang Qiu +8
Omni-modal models have expanded multimodal interaction across vision, audio, speech, and language. However, their training is predominantly organized around semantic descriptions a…