3 papers
cs.CV2025
CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation
Qinglin Zeng, Kaitong Cai, Ruiqi Chen +2
Maintaining narrative coherence and visual consistency remains a central challenge in open-domain video generation. Existing text-to-video models often treat each shot independentl…
cs.CV2025
PTTA: A Pure Text-to-Animation Framework for High-Quality Creation
Ruiqi Chen, Kaitong Cai, Yijia Fan +1
Traditional animation production involves complex pipelines and significant manual labor cost. While recent video generation models such as Sora, Kling, and CogVideoX achieve impre…
cs.CV2025
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
Jusheng Zhang, Kaitong Cai, Xiaoyang Guo +10
The ability to perform Chain-of-Thought (CoT) reasoning marks a major milestone for multimodal models (MMs), enabling them to solve complex visual reasoning problems. Yet a critica…