2 papers
cs.SD2025
QvTAD: Differential Relative Attribute Learning for Voice Timbre Attribute Detection
Zhiyu Wu, Jingyi Fang, Yufei Tang +3
Voice Timbre Attribute Detection (vTAD) plays a pivotal role in fine-grained timbre modeling for speech generation tasks. However, it remains challenging due to the inherently subj…
cs.CV2025
Combining Knowledge Graph and LLMs for Enhanced Zero-shot Visual Question Answering
Qian Tao, Xiaoyang Fan, Yong Xu +2
Zero-shot visual question answering (ZS-VQA), an emerged critical research area, intends to answer visual questions without providing training samples. Existing research in ZS-VQA…