1 paper
Lunjie Zhu, Xingtong Ge, Fangyu Lin +7
Joint audio-video generative models serve as foundation for immersive and interactive digital-human generation. Nevertheless, most existing models rely on bidirectional attention a…