2 papers
cs.HC2024
G-VOILA: Gaze-Facilitated Information Querying in Daily Scenarios
Zeyu Wang, Yuanchun Shi, Yuntao Wang +6
Modern information querying systems are progressively incorporating multimodal inputs like vision and audio. However, the integration of gaze -- a modality deeply linked to user in…
cs.CV2023
Voila-A: Aligning Vision-Language Models with User's Gaze Attention
Kun Yan, Lei Ji, Zeyu Wang +3
In recent years, the integration of vision and language understanding has led to significant advancements in artificial intelligence, particularly through Vision-Language Models (V…