1 paper
Chun-Yi Kuan, Siwon Kim, Byeonggeun Kim +7
Recent text-to-audio models generate high-quality audio, but often fail to follow instructions involving multiple sound events and temporal order. This gap arises because existing…