5 papers
Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning
Yuqi Zhang, Yadan Luo, Xiangyu Sun +3
High-quality 3D scene assets are critical for embodied applications such as robotic manipulation, navigation, and simulation. Despite their strong object priors, recent single-imag…
TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction
Fengyi Zhang, Tianjun Zhang, Kasra Khosoussi +3
3D vision foundation models have shown strong generalization in reconstructing key 3D attributes from uncalibrated images through a single feed-forward pass. However, when deployed…
Test-Time 3D Occupancy Prediction
Fengyi Zhang, Xiangyu Sun, Huitong Yang +3
Self-supervised 3D occupancy prediction offers a promising solution for understanding complex driving scenes without requiring costly 3D annotations. However, training dense occupa…
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model
Xiangyu Sun, Shijie Wang, Fengyi Zhang +5
World models that forecast scene evolution by generating future video frames devote the bulk of their capacity to photometric details, yet the resulting predictions often remain ge…
CodeMerge: Codebook-Guided Model Merging for Robust Test-Time Adaptation in Autonomous Driving
Huitong Yang, Zhuoxiao Chen, Fengyi Zhang +2
Maintaining robust 3D perception under dynamic and unpredictable test-time conditions remains a critical challenge for autonomous driving systems. Existing test-time adaptation (TT…