1 paper · 1 filter
Yaofeng Su, Yuming Li, Zeyue Xue +7
Recent joint audio-visual diffusion models achieve remarkable generation quality but suffer from high latency due to their bidirectional attention dependencies, hindering real-time…