1 paper · 1 filter
Renda Li, Xiaohua Qi, Qiang Ling +4
Audio-driven cospeech video generation typically involves two stages: speech-to-gesture and gesture-to-video. While significant advances have been made in speech-to-gesture generat…