1 paper
Xijun Wang, Junbang Liang, Chun-Kai Wang +4
In this work, we propose an efficient Video-Language Alignment (ViLA) network. Our ViLA model addresses both efficient frame sampling and effective cross-modal alignment in a unifi…