1 paper
Jin Chen, Kaijing Ma, Haojian Huang +4
The development of multi-modal models has been rapidly advancing, with some demonstrating remarkable capabilities. However, annotating video-text pairs remains expensive and insuff…