1 paper
Weixi Feng, Chao Liu, Sifei Liu +3
Existing video generation models struggle to follow complex text prompts and synthesize multiple objects, raising the need for additional grounding input for improved controllabili…