Showing cs.CVShow all
3 papers · 1 filter
cs.CV2026
Compositional Semantics for Open Vocabulary Spatio-semantic Representations
Robin Karlsson, Francisco Lepe-Salazar, Kazuya Takeda
Vision-language models (VLMs) transform environment percepts into vision-language semantics interpretable by LLMs. However, completing complex tasks often requires reasoning about…
cs.CV2024
MulCPred: Learning Multi-modal Concepts for Explainable Pedestrian Action Prediction
Yan Feng, Alexander Carballo, Keisuke Fujii +3
Pedestrian action prediction is of great significance for many applications such as autonomous driving. However, state-of-the-art methods lack explainability to make trustworthy pr…
cs.CV2024
Runner re-identification from single-view running video in the open-world setting
Tomohiro Suzuki, Kazushi Tsutsui, Kazuya Takeda +1
In many sports, player re-identification is crucial for automatic video processing and analysis. However, most of the current studies on player re-identification in multi- or singl…