3 papers
cs.CV2026
When Negation Is a Geometry Problem in Vision-Language Models
Fawaz Sammani, Tzoulio Chamiti, Paul Gavrikov +1
Joint Vision-Language Embedding models such as CLIP typically fail at understanding negation in text queries, for example, failing to distinguish "no" in the query: "a plain blue s…
cs.CV2025
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
Tzoulio Chamiti, Leandro Di Bella, Adrian Munteanu +1
Tracking multiple objects based on textual queries is a challenging task that requires linking language understanding with object association across frames. Previous works typicall…
cs.CV2025
Large Models in Dialogue for Active Perception and Anomaly Detection
Tzoulio Chamiti, Nikolaos Passalis, Anastasios Tefas
Autonomous aerial monitoring is an important task aimed at gathering information from areas that may not be easily accessible by humans. At the same time, this task often requires…