Showing cs.SDShow all
2 papers · 1 filter
cs.SD2025
MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
Xiaoran Yang, Jianxuan Yang, Xinyue Guo +3
A key challenge in synthesizing audios from silent videos is the inherent trade-off between synthesis quality and inference efficiency in existing methods. For instance, flow match…
cs.SD2025
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
Yuxuan He, Xiaoran Yang, Ningning Pan +1
Most existing text-to-audio (TTA) generation methods produce mono outputs, neglecting essential spatial information for immersive auditory experiences. To address this issue, we pr…