3 papers
cs.CV2026
AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
Jingqi Tian, Haoji Zhang, Lin Chen +7
Chain-of-thought (CoT) reasoning can improve performance on difficult video questions but often wastes decoding tokens on simple ones. We study whether a video multimodal large lan…
cs.CV2025
Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation
Tianrui Zhu, Shiyi Zhang, Zhirui Sun +2
Frame-level autoregressive (frame-AR) models have achieved significant progress, enabling real-time video generation comparable to bidirectional diffusion models and serving as a f…
cs.CV2024
Ponder & Press: Advancing Visual GUI Agent towards General Computer Control
Yiqin Wang, Haoji Zhang, Jingqi Tian +1
Most existing GUI agents typically depend on non-vision inputs like HTML source code or accessibility trees, limiting their flexibility across diverse software environments and pla…