1 paper · 1 filter
Xijun Wang, Junbang Liang, Chun-Kai Wang +4
In this work, we propose an efficient Video-Language Alignment (ViLA) network. Our ViLA model addresses both efficient frame sampling and effective cross-modal alignment in a unifi…