5 papers
On Test-Time Scaling for Vision-Language Models
Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis
Test-time scaling is a paradigm where large models use additional compute at inference to achieve better performance, without changing model weights. While it has been widely studi…
GATA2Floor: Graph attention for floor counting in street-view facades
Ngoc Tan Le, Tzoulio Chamiti, Eirini Papagiannopoulou +1
Automated analysis of building facades from street-level imagery has great potential for urban analytics, energy assessment, and emergency planning. However, it requires reasoning…
When Negation Is a Geometry Problem in Vision-Language Models
Fawaz Sammani, Tzoulio Chamiti, Paul Gavrikov +1
Joint Vision-Language Embedding models such as CLIP typically fail at understanding negation in text queries, for example, failing to distinguish "no" in the query: "a plain blue s…
ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking
Tzoulio Chamiti, Leandro Di Bella, Adrian Munteanu +1
Tracking multiple objects based on textual queries is a challenging task that requires linking language understanding with object association across frames. Previous works typicall…
Large Models in Dialogue for Active Perception and Anomaly Detection
Tzoulio Chamiti, Nikolaos Passalis, Anastasios Tefas
Autonomous aerial monitoring is an important task aimed at gathering information from areas that may not be easily accessible by humans. At the same time, this task often requires…