1 paper
Roy Fejgin, Paarth Neekhara, Xuesong Yang +6
Speech generation models based on large language models (LLMs) typically operate on discrete acoustic codes, which differ fundamentally from text tokens due to their multicodebook…