1 paper · 1 filter
Killian Steunou, Anas Filali Razzouki, Khalil Guetari +3
Video-language models can process only a limited number of frames, making frame selection a key bottleneck for efficient video captioning. Most captioning pipelines still rely on u…