3 papers
cs.RO2025
Avi: Action from Volumetric Inference
Harris Song, Long Le
We propose Avi, a novel 3D Vision-Language-Action (VLA) architecture that reframes robotic action generation as a problem of 3D perception and spatial reasoning, rather than low-le…
cs.CV2025
HiddenObject: Modality-Agnostic Fusion for Multimodal Hidden Object Detection
Harris Song, Tuan-Anh Vu, Sanjith Menon +2
Detecting hidden or partially concealed objects remains a fundamental challenge in multimodal environments, where factors like occlusion, camouflage, and lighting variations signif…
cs.CV2025
Reconstruction Using the Invisible: Intuition from NIR and Metadata for Enhanced 3D Gaussian Splatting
Gyusam Chang, Tuan-Anh Vu, Vivek Alumootil +4
While 3D Gaussian Splatting (3DGS) has rapidly advanced, its application in agriculture remains underexplored. Agricultural scenes present unique challenges for 3D reconstruction m…