1 paper
Jiawen Lin, Shiran Bian, Yihang Zhu +4
3D Visual Grounding (3DVG) aims to localize objects in 3D scenes using natural language descriptions. Although supervised methods achieve higher accuracy in constrained settings, z…