1 paper · 1 filter
Se Jin Park, Julian Salazar, Aren Jansen +3
We consider the generative modeling of speech over multiple minutes, a requirement for long-form multimedia generation and audio-native voice assistants. However, textless spoken l…