1 paper
Xiaohan Zhang, Yuqing Wen, Junlin Chen +9
Multi-reference-to-audio-video (MR2AV) generation aims to generate coherent audio-video content conditioned on multiple references and textual instructions. Existing benchmarks mai…