1 paper · 1 filter
Menglin Han, Yang Ding, Yulei Lu +6
Real-time long-form avatar audio-video generation requires causal, continuous synthesis while maintaining audiovisual synchronization and visual consistency. Adapting a pretrained…