3 papers
cs.CV2026
ChatImage: Navigating Long-Form LLM Answers through Interactive Images
Wencan Jiang, Jiangning Zhang, Yong Liu
Large Language Models (LLMs) can produce detailed answers to complex queries, but these answers are typically presented as dense linear text, which makes fine-grained inspection, n…
cs.CV2026
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
Jinzhuo Liu, Jiangning Zhang, Wencan Jiang +5
Autoregressive video generation has improved rapidly in visual fidelity and interactivity, but it still suffers from long-term inconsistency and memory degradation. Most existing s…
cs.CV2026
SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents
Wencan Jiang, Jiangning Zhang, Jianbiao Mei +6
Long-horizon multimodal agents in open-world games must stay goal-directed across many low-level interactions under tight token and latency budgets. Existing approaches often trade…