3 papers
cs.CV2026
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
Vladislav Makarov, Mark Gizetdinov, Dmitry Yudin
Scene graph generation provides a compact structured representation for visual perception, but accurate and fast graph prediction from images and videos remains challenging. Recent…
cs.RO2026
Knowledge-Guided Manipulation Using Multi-Task Reinforcement Learning
Aditya Narendra, Mukhammadrizo Maribjonov, Dmitry Makarov +2
This paper introduces Knowledge Graph based Massively Multi-task Model-based Policy Optimization (KG-M3PO), a framework for multi-task robotic manipulation in partially observable…
cs.CV2025
RCDINO: Enhancing Radar-Camera 3D Object Detection with DINOv2 Semantic Features
Olga Matykina, Dmitry Yudin
Three-dimensional object detection is essential for autonomous driving and robotics, relying on effective fusion of multimodal data from cameras and radar. This work proposes RCDIN…