1 paper · 1 filter
Yizhou Liu, Jinghang Han, Kaixiang Qiu +8
Omni-modal models have expanded multimodal interaction across vision, audio, speech, and language. However, their training is predominantly organized around semantic descriptions a…