1 paper · 1 filter
Chun-Yi Kuan, Siwon Kim, Byeonggeun Kim +7
Recent text-to-audio models generate high-quality audio, but often fail to follow instructions involving multiple sound events and temporal order. This gap arises because existing…