Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
Persistent Object Narratives for Token-Efficient Video Language Models
Junzhe Chen, Siyuan Meng, Xiaojie Guo
Video large language models (Video-LLMs) have made strong progress in open-ended video understanding. However, their visual interfaces remain token-intensive and provide limited ex…
cs.CV2026
Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution
Tian Qin, Junzhe Chen, Yuqing Shi +3
Large vision-language models (LVLMs) often hallucinate when language priors dominate weak or ambiguous visual evidence. Existing contrastive decoding methods mitigate this problem…
cs.CV2026
TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models
Junzhe Chen, Siyuan Meng, Yuxi Chen +3
Video large language models (Video-LLMs) have made strong progress in general video understanding, but their ability to maintain temporal object consistency remains underexplored.…