1 citations · 1 across the 1 of their papers we have counts for
3 papers
cs.SD2025
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
Wenhao You, Xingjian Diao, Wenjun Huang +9
While recent Multimodal Large Language Models exhibit impressive capabilities for general multimodal tasks, specialized domains like music necessitate tailored approaches. Music Au…
cs.CV2025★ 1 cited
Learning Musical Representations for Music Performance Question Answering
Xingjian Diao, Chunhui Zhang, Tingxuan Wu +4
Music performances are representative scenarios for audio-visual modeling. Unlike common scenarios with sparse audio, music performances continuously involve dense audio signals th…
cs.MM2025
MSM-BD: Multimodal Social Media Bot Detection Using Heterogeneous Information
Tingxuan Wu, Zhaorui Ma, Yanjun Cui +2
Although social bots can be engineered for constructive applications, their potential for misuse in manipulative schemes and malware distribution cannot be overlooked. This dichoto…