5 papers
Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding
Kadir Yilmaz, Adrian Kruse, Tristan Höfer +3
Transformers have become a common foundation across deep learning, yet 3D scene understanding still relies on specialized backbones with strong domain priors. This isolates the fie…
DINO in the Room: Leveraging 2D Foundation Models for 3D Segmentation
Karim Knaebel, Kadir Yilmaz, Daan de Geus +4
Vision foundation models (VFMs) trained on large-scale image datasets provide high-quality features that have significantly advanced 2D visual recognition. However, their potential…
Acquisition of high-quality images for camera calibration in robotics applications via speech prompts
Timm Linder, Kadir Yilmaz, David B. Adrian +1
Accurate intrinsic and extrinsic camera calibration can be an important prerequisite for robotic applications that rely on vision as input. While there is ongoing research on enabl…
Interactive4D: Interactive 4D LiDAR Segmentation
Ilya Fradlin, Idil Esen Zulfikar, Kadir Yilmaz +2
Interactive segmentation has an important role in facilitating the annotation process of future LiDAR datasets. Existing approaches sequentially segment individual objects at each…
Mask4Former: Mask Transformer for 4D Panoptic Segmentation
Kadir Yilmaz, Jonas Schult, Alexey Nekrasov +1
Accurately perceiving and tracking instances over time is essential for the decision-making processes of autonomous agents interacting safely in dynamic environments. With this int…