1 paper
Zhenxin Qin, Peng Shi, Cong Han +3
Video understanding demands a convergence of complementary capabilities across perception, temporal understanding, and complex reasoning, which are difficult to jointly optimize wi…