1 paper
Jinlong Yang, Wenhao Zhang, Kuanwei Lin +1
Long-video understanding increasingly relies on large vision-language models and tool-augmented reasoning, but most systems apply the same inference procedure to every example rega…