1 paper · 1 filter
Zizhen Wang, Bo Feng, Zhengfeng Lai +5
Evaluating video captioning remains a critical challenge for Visual Large Language Models (VLLMs). Existing metrics primarily rely on matching generated text against ground-truth r…