3 papers
cs.CV2026
Persistent Object Narratives for Token-Efficient Video Language Models
Junzhe Chen, Siyuan Meng, Xiaojie Guo
Video large language models (Video-LLMs) have made strong progress in open-ended video understanding. However, their visual interfaces remain token-intensive and provide limited ex…
cs.CV2026
TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models
Junzhe Chen, Siyuan Meng, Yuxi Chen +3
Video large language models (Video-LLMs) have made strong progress in general video understanding, but their ability to maintain temporal object consistency remains underexplored.…
cs.CV2026
Infrastructure-Centric World Models: Bridging Temporal Depth and Spatial Breadth for Roadside Perception
Siyuan Meng, Chengbo Ai
World models, generative AI systems that simulate how environments evolve, are transforming autonomous driving, yet all existing approaches adopt an ego-vehicle perspective, leavin…