2 papers
cs.CV2026
STORM-Bench: Evaluating Online Video QA under Evolving and Incomplete Evidence
Siru Zhong, Shenghan Tan, Rihong Yan +6
Reliable online video question answering requires tracking state transitions while selectively abstaining when visual evidence is insufficient. Existing benchmarks focus on static…
cs.CV2026
PREM: Prefix-Steered Recurrent Memory for Long-Video Understanding
Siru Zhong, Qiongyan Wang, Xiaohui Lv +5
Long-video understanding must capture transient visual evidence under strict token budgets, yet existing methods compress frames, append memory tokens, or alter internal key-value…