3 papers
cs.CV2026
The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering
Yuqian Fu, Tianwen Qian, Yanjun Li +30
EgoCross is a cross-domain egocentric video question answering benchmark designed to evaluate whether multimodal large language models can generalize beyond common daily-life scena…
cs.CV2026
Reflective Dialogue between Teacher and Solver Agents for Video Question Answering
Takuya Murakawa, Toru Tamaki
Various approaches have been proposed to adapt Vision-Language Models (VLMs) to specialized domains for Video Question Answering, including fine-tuning and in-context learning. How…
cs.CV2023
S3Aug: Segmentation, Sampling, and Shift for Action Recognition
Taiki Sugiura, Toru Tamaki
Action recognition is a well-established area of research in computer vision. In this paper, we propose S3Aug, a video data augmenatation for action recognition. Unlike conventiona…