2 papers
cs.CV2026
AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models
Cuong Huynh, Maxim Popov, Denis Gridusov +1
3D Visual Grounding (3DVG) is an essential capability for embodied AI, requiring agents to localize objects in 3D scenes based on natural language descriptions. Recent zero-shot me…
cs.CV2026
Accelerated Spatio-Temporal Gaussian Rendering via Kinematic and Semantic Priors
Denis Gridusov, Maxim Popov, Sergey Kolyubin
Reconstructing dynamic 3D scenes from multi-view videos is a foundational task for robotics, AR/VR, and digital twins. While 3D Gaussian Splatting (3DGS) provides state-of-the art…