1 paper · 1 filter
Hyunwoo Oh, SeungJu Cha, Kwanyoung Lee +2
We propose CatchPhrase, a novel audio-to-image generation framework designed to mitigate semantic misalignment between audio inputs and generated images. While recent advances in m…