1 paper
Quanyue Song, Yishan He, Yanfei Zhang +6
Recent diffusion-based models have enabled realistic audio-driven avatar generation in real-time streaming. However, existing approaches struggle to maintain visual temporal consis…