3 papers
cs.CV2026
Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence
Yuhan Wang, Shuochen Chang, Yalin Feng +8
Vision-language models (VLMs) have achieved strong performance on visual question answering (VQA). To mitigate individual hallucinations and blind spots, aggregating diverse perspe…
cs.HC2024
SimTube: Generating Simulated Video Comments through Multimodal AI and User Personas
Yu-Kai Hung, Yun-Chien Huang, Ting-Yu Su +4
Audience feedback is crucial for refining video content, yet it typically comes after publication, limiting creators' ability to make timely adjustments. To bridge this gap, we int…
cs.CL2023
Location-Aware Visual Question Generation with Lightweight Models
Nicholas Collin Suwono, Justin Chih-Yao Chen, Tun Min Hung +5
This work introduces a novel task, location-aware visual question generation (LocaVQG), which aims to generate engaging questions from data relevant to a particular geographical lo…