1 paper · 1 filter
Jiulin Li, Ping Huang, Yexin Li +3
Real-world multimodal applications often require any-to-any capabilities, enabling both understanding and generation across modalities including text, image, audio, and video. Howe…