1 paper · 1 filter
Bowen Yang, Yun Cao, Chen He +1
Text-to-video retrieval requires precise alignment between language and temporally rich audio-video signals. However, existing methods often emphasize visual cues while underutiliz…