1 paper
Yiming Zhang, Xuenan Xu, Ruoyi Du +5
In traditional audio captioning methods, a model is usually trained in a fully supervised manner using a human-annotated dataset containing audio-text pairs and then evaluated on t…