2 papers
cs.CV2026
Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory
Yanbo Ding, Zhizhi Guo, Quanyue Song +4
Audio-video generative models achieve impressive quality but suffer from high latency, making them unsuitable for real-time applications. Although several streaming audio-video gen…
cs.CV2026
OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars
Quanyue Song, Yishan He, Yanbo Ding +4
Recent advances in diffusion-based generative models have enabled real-time audio-driven avatar generation and unified audio-visual synthesis, providing a promising foundation for…