2 papers
cs.CV2026
Think Locally, Refine Globally for Memory-Efficient 3D Reconstruction
Jingke Zhou, Chenhang Ma, Zhizhou Zhong +6
We propose LoG-VGGT, a memory-efficient framework for long-sequence 3D reconstruction that balances local temporal modeling with global camera consistency. Instead of relying on fu…
cs.RO2026
StrataVLA: Hierarchical and Efficient 3D Geometric Grounding for Vision-Language-Action Models
Jin Cui, Zhaoyu Pu, Botao Cai +4
Vision-Language-Action (VLA) models inherit strong semantic priors from large-scale vision-language pretraining, yet remain limited in robotic manipulation by insufficient 3D spati…