collaborators

5 papers

cs.CV2026

On Test-Time Scaling for Vision-Language Models

Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

Test-time scaling is a paradigm where large models use additional compute at inference to achieve better performance, without changing model weights. While it has been widely studi…

cs.CV2026

GATA2Floor: Graph attention for floor counting in street-view facades

Ngoc Tan Le, Tzoulio Chamiti, Eirini Papagiannopoulou +1

Automated analysis of building facades from street-level imagery has great potential for urban analytics, energy assessment, and emergency planning. However, it requires reasoning…

cs.CV2026

When Negation Is a Geometry Problem in Vision-Language Models

Fawaz Sammani, Tzoulio Chamiti, Paul Gavrikov +1

Joint Vision-Language Embedding models such as CLIP typically fail at understanding negation in text queries, for example, failing to distinguish "no" in the query: "a plain blue s…

cs.CV2025

ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking

Tzoulio Chamiti, Leandro Di Bella, Adrian Munteanu +1

Tracking multiple objects based on textual queries is a challenging task that requires linking language understanding with object association across frames. Previous works typicall…

cs.CV2025

Large Models in Dialogue for Active Perception and Anomaly Detection

Tzoulio Chamiti, Nikolaos Passalis, Anastasios Tefas

Autonomous aerial monitoring is an important task aimed at gathering information from areas that may not be easily accessible by humans. At the same time, this task often requires…