3 papers
cs.MM2026
From Natural Alignment to Conditional Controllability in Multimodal Dialogue
Zeyu Jin, Songtao Zhou, Haoyu Wang +5
The recent advancement of Artificial Intelligence Generated Content (AIGC) has led to significant strides in modeling human interaction, particularly in the context of multimodal d…
cs.MM2026
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
Zeyu Jin, Xiaoyu Qin, Songtao Zhou +2
Soccer commentary plays a crucial role in enhancing the soccer game viewing experience for audiences. Previous studies in automatic soccer commentary generation typically adopt an…
cs.HC2025
V-CASS: Vision-context-aware Expressive Speech Synthesis for Enhancing User Understanding of Videos
Qixin Wang, Songtao Zhou, Zeyu Jin +3
Automatic video commentary systems are widely used on multimedia social media platforms to extract factual information about video content. However, current systems may overlook es…