2 papers
cs.CV2026
Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey
Bingzheng Qu, Kehai Chen, Xuefeng Bai +1
Recent progress in multimodal large language models (MLLMs) is reshaping video translation from a cascaded pipeline of automatic speech recognition, machine translation, text-to-sp…
cs.CV2026
Beyond Rigid: Benchmarking Non-Rigid Video Editing
Bingzheng Qu, Xuefeng Bai, Kehai Chen +1
As video generation models are increasingly expected to manipulate physical dynamics, there is a growing need to move evaluation beyond appearance fidelity and semantic alignment.…