2 papers
cs.CV2025
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
Li Yu, Xuanzhe Sun, Wei Zhou +1
Video saliency prediction is crucial for downstream applications, such as video compression and human-computer interaction. With the flourishing of multimodal learning, researchers…
cs.CV2024
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
Li Yu, Xuanzhe Sun, Pan Gao +1
Audio data, often synchronized with video frames, plays a crucial role in guiding the audience's visual attention. Incorporating audio information into video saliency prediction ta…