Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents
Bingnan Liu, Chenhang Cui, Rui Huang +7
We introduce WildRoadBench, a wild aerial road-damage grounding benchmark that couples direct visual grounding by vision-language models with autonomous research-and-engineering by…
cs.CV2026
VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning
Shaoyang Cui, Lingbei Meng, Yaodi Luo +1
Video-grounded numerical reasoning requires Vision-Language Models (VLMs) to identify, track, and combine quantitative evidence across frames, actions, and scene changes. Existing…
cs.CV2024
AugGS: Self-augmented Gaussians with Structural Masks for Sparse-view 3D Reconstruction
Bi'an Du, Lingbei Meng, Wei Hu
Sparse-view 3D reconstruction is a major challenge in computer vision, aiming to create complete three-dimensional models from limited viewing angles. Key obstacles include: 1) a s…