3 papers
cs.CV2026
Stateful Visual Encoders for Vision-Language Models
Zirui Wang, Junwei Yu, Adam Yala +3
Vision-language models (VLMs) are increasingly used in multi-image, multi-turn agentic settings where decisions depend on visual changes. However, in existing open-weight VLMs, vis…
cs.CV2026
VT-3DAD: Cross-Category 3D Anomaly Detection via Visual-Text Normal Space Alignment
Zi Wang, Katsuya Hotta, Yawen Zou +4
Few-shot cross-category 3D anomaly detection aims to determine whether an unknown point cloud belongs to a target normal category using only a few normal references. Existing train…
cs.CV2025
DualDiff: Dual-branch Diffusion Model for Autonomous Driving with Semantic Fusion
Haoteng Li, Zhao Yang, Zezhong Qian +5
Accurate and high-fidelity driving scene reconstruction relies on fully leveraging scene information as conditioning. However, existing approaches, which primarily use 3D bounding…